Por que eu devo ler este artigo:Hoje em dia, principalmente devido ao avanço nos dispositivos móveis, o reconhecimento de voz em aplicações tem se tornado uma realidade. Com a presença massiva de microfones e alto-falantes nos dispositivos, é muito interessante utilizar reconhecimento e síntese de voz em aplicações. Para isso, o Bing Speech é uma excelente opção, e muito simples de ser utilizado em aplicações Windows 8 e Windows Phone 8.

Ele é dividido em duas APIs básicas: uma para reconhecimento, e outra para síntese de voz, sendo a primeira baseada em um web service e a segunda sendo baseada em streams de áudio, criadas a partir de strings. Esse artigo apresenta essa API e ensina como utilizá-la para criar texto a partir da fala (reconhecimento de voz) e fazer a aplicação fornecer feedbacks de áudio ao usuário (síntese de voz).

Atualmente, temos visto um avanço muito grande em tecnologias que, até poucos anos atrás, não eram nem sequer cogitadas. Os avanços na Inteligência Artificial foram muitos na área de reconhecimento e síntese de voz, o que faz com que essa tecnologia nem seja tratada mais como um conceito de IA, já tendo se desvinculado e se tornado um campo totalmente independente.

As possibilidades que os dispositivos “inteligentes” oferecem são muitas e é preciso que o desenvolvedor saiba utilizá-las para criar a melhor experiência possível para os usuários.

Nesse contexto, o Windows 8 traz uma tecnologia que vem se consolidando desde o seu lançamento e tem atraído os olhares dos usuários ao redor do mundo. Isso se dá pelo fato de ser uma tecnologia, visualmente falando, extremamente atrativa ao usuário comum. Além disso, se trata de um sistema muito simples de ser utilizado, muito intuitivo.

Para o desenvolvedor, o Windows 8 também traz uma série de benefícios, principalmente a partir da Windows Store, onde é possível comercializarmos aplicações com todos os usuários da plataforma.

Com o aumento do poder de processamento dos dispositivos, cada vez mais os usuários tem buscado elementos que melhorem sua experiência ao utilizar aplicações. Pensando nisso, o Bing oferece uma série de APIs e controles que auxiliam os desenvolvedores na hora de aplicar essas tecnologias às suas aplicações.

Um deles é o Bing Speech Control, controle destinado à adição de comandos, reconhecimento e síntese de voz em aplicações Windows 8 e Windows Phone 8. Trata-se de um controle bastante simples de ser utilizado, e é possível criarmos aplicações extremamente ricas tratando de assuntos como a navegação através de comandos de voz, entre outros elementos interessantes.

Reconhecimento de discurso

O reconhecimento de discurso, ou Speech Recnognition, é a capacidade de tradução da fala em texto. Trata-se de um campo que até pouco tempo atrás estava nos braços da Inteligência Artificial, e que hoje em dia é um campo de estudos independente. É muito comum vermos, em salas de aula ao redor do Brasil e do mundo, professores ditando conteúdo para seus alunos.

O reconhecimento de voz funciona dessa forma: a diferença é que o usuário está ditando para o dispositivo. A utilização dessa tecnologia inclui operações presentes em diversos dispositivos modernos, como chamadas por voz, pesquisa, entrada de dados e aviação. É um conceito que leva diretamente a outro, muito utilizado em segurança de sistemas de informação, que é o reconhecimento de voz, ou Voice Recognition (BOX 1).

BOX 1. Voice Recnognition

O reconhecimento de voz é uma aplicação bastante interessante da tecnologia de Speech Recognition, que diz respeito muito mais à segurança de sistemas de informação do que qualquer outra coisa. É um conceito que trata da identificação das pessoas através da voz das mesmas.

Todos sabem que cada pessoa possui uma tonalidade de voz única, embora muitas tenham vozes muito parecidas. Para nós, pode ser bastante complicado identificarmos a pessoa apenas através de sua voz em alguns casos, mas os computadores possuem a capacidade de distinguir mesmo vozes muito similares.

É um conceito que é bastante confundido com o conceito de reconhecimento de discurso, que é responsável por identificar o que está sendo dito, e não quem está dizendo.

As tecnologias atuais de reconhecimento de discurso podem ser aplicadas em diversas áreas, começando pela saúde, onde surge como um meio de facilitar a escrita de relatórios médicos, prescrições, entre outros, até telefonia e aviação, onde pode ser utilizado nos sistemas de controle.

Algumas dessas aplicações podem trazer problemas na utilização dessa tecnologia, devido a barul ...

Fim do trecho gratuito • continue abaixo
CONTEÚDO EXCLUSIVO

Desbloqueie toda a DevMedia

  • +2000 artigos e vídeos
  • +40 trilhas sobre Front-end, Back-end, IA e muito mais
  • +5000 exercícios práticos
  • Mentorias ao vivo individuais
até 50% OFF
A partir de
R$ 69 /mês
Assinar agora