Ir al contenido
Última hora
Publicidad
Espacio
disponible
Publicidad 160 × 600 Anúnciate aquí (829) 749-3900
Publicidad
Espacio
disponible
Publicidad 160 × 600 Anúnciate aquí (829) 749-3900
Publicidad Campaña institucional Salvador y Esperanza

Google presenta Gemini 3.5 Transcribe: la nueva herramienta de IA para conversión de audio a texto con más de 85 idiomas

Google lanza Gemini 3.5 Transcribe: IA para convertir audio a texto

Compartir

 Google lanza Gemini 3.5 Transcribe, una avanzada herramienta de inteligencia artificial capaz de convertir voz en texto, reconocer más de 85 idiomas y distinguir acentos y hablantes con alta precisión.

Google lanza Gemini 3.5 Transcribe: IA para convertir audio a texto

MOUNTAIN VIEW, CALIFORNIA. – Google ha anunciado el lanzamiento oficial de Gemini 3.5 Transcribe, una innovadora herramienta de inteligencia artificial diseñada para transformar la conversión de audio en texto, destacándose por su capacidad para reconocer más de 85 idiomas, adaptarse a acentos regionales marcados y distinguir con precisión a múltiples hablantes en una misma conversación.

La nueva tecnología está concebida para operar en entornos multilingües complejos, detectando de manera automática cambios de idioma sobre la marcha. Esto la convierte en un recurso clave para reuniones internacionales, entrevistas de medios, conferencias corporativas, llamadas de alta exigencia y la generación automatizada de subtítulos.

Alcance lingüístico y vocabulario especializado

Uno de los pilares de Gemini 3.5 Transcribe es su robustez idiomática. El modelo no solo procesa audios en más de 85 lenguas, sino que se ajusta a diferentes variantes de pronunciación, reduciendo drásticamente los errores comunes de los sistemas de transcripción convencionales.

Entre sus capacidades técnicas destacan:

  • Reconocimiento de acentos y jergas: Excelente desempeño ante modulaciones regionales y términos técnicos complejos.

  • Aplicación sectorial: Diseñada para sectores altamente especializados como el derecho, la medicina, la tecnología y los negocios, donde la precisión terminológica es crítica.

  • Identificación de interlocutores: El sistema separa de forma inteligente las intervenciones de diferentes hablantes dentro de una misma pista de audio.

Transmisión en vivo y precisión mejorada

Lejos de limitarse a una copia literal de los audios, la IA incorpora filtros inteligentes para eliminar muletillas, corregir repeticiones y formatear de manera automática el texto con puntuación y uso correcto de mayúsculas.

De acuerdo con los datos técnicos divulgados por la compañía, el modelo alcanza estándares de exactitud muy elevados:

  • Una tasa promedio de error de apenas el 4 % en transmisiones en vivo.

  • Una reducción al 2.6 % de margen de error en archivos de audio pregrabados.

La plataforma opera bajo dos modalidades principales: una de baja latencia para tiempo real y otra orientada a archivos almacenados que añade marcas de tiempo (timestamps) y separación de voces.

Integración en el ecosistema de Google

Google confirmó que esta tecnología se integrará de manera progresiva en sus principales productos y servicios de consumo y productividad, incluyendo el teclado Gboard para Android, la aplicación oficial de Gemini y otras plataformas corporativas, expandiendo significativamente las funciones de dictado y subtitulado inteligente a nivel global.

EPI
Elpoderinformativo

Portal dominicano de noticias: cobertura de actualidad nacional e internacional, análisis y reportajes.

Publicidad

Te puede interesar