A gigante tecnológica norte-americana anunciou esta semana o lançamento de dois novos modelos de inteligência artificial destinados a programadores. As ferramentas Gemini 3.8 Live e Gemini 3.5 Transcribe chegam ao mercado através da interface de programação de aplicações Gemini Live. O objectivo principal passa por ajudar a construir agentes de voz de baixa latência, capazes de manter conversas fluidas em tempo real. Esta expansão do ecossistema de inteligência artificial surge pouco tempo depois de a Google lançar uma aplicação nativa do Gemini para computadores Windows, a demonstrar uma aposta contínua na integração destas tecnologias em diversas plataformas diárias.
O poder da visão e da voz no Gemini Live
O modelo Gemini 3.8 Live foi desenhado especificamente para conversas verbais rápidas e dinâmicas. O sistema consegue executar chamadas de ferramentas em segundo plano enquanto transmite respostas de áudio sem qualquer tipo de interrupção. Uma das características mais impressionantes é a capacidade de analisar imagens e vídeos em directo a uma taxa de um fotograma por segundo, a ligar de forma orgânica o discurso dos utilizadores àquilo que estão a ver no ecrã. A plataforma suporta 97 idiomas e promete sotaques incrivelmente realistas, a permitir ainda a mudança automática de língua a meio de uma frase sem quebrar o ritmo da conversa.
As sessões de interacção têm limites de tempo bem definidos para garantir a estabilidade do serviço. Os utilizadores podem manter conversas exclusivas de áudio durante 15 minutos, mas este valor desce drasticamente para dois minutos quando a interacção envolve processamento simultâneo de som e vídeo. No que diz respeito aos custos operacionais para as empresas, os preços começam nos 0,005 dólares por minuto para a entrada de áudio e fixam-se nos 0,018 dólares por minuto para a saída sonora.
Transcrições precisas com o novo modelo dedicado
Para necessidades específicas de conversão de voz em texto, a empresa desvendou o Gemini 3.5 Transcribe. Esta solução oferece duas vias de acesso distintas aos programadores, a começar pela interface Live, focada na transmissão em tempo real com legendas geradas com uma latência inferior a um segundo. A segunda opção é a interface de Interacções, concebida para processar ficheiros de áudio pré-gravados com uma duração máxima de uma hora. Esta última ferramenta inclui a capacidade de identificar diferentes oradores num mesmo ficheiro e atribuir marcas de tempo exactas a cada palavra pronunciada.
O sistema de transcrição consegue lidar fluentemente com 85 idiomas diferentes, a oferecer detecção automática e um tratamento cuidadoso de sotaques regionais. A margem de erro das palavras situa-se na casa dos 4% para transmissões em directo e desce para os 2,6% em processamentos de ficheiros estáticos. Todos os áudios gerados por estas plataformas incluem a marca de água SynthID para ajudar a detectar conteúdos criados por inteligência artificial e prevenir a desinformação, uma preocupação de segurança que vai ao encontro de outras medidas recentes, como a altura em que a Google lançou uma actualização para a gama Pixel com detecção de fraudes.
