Google объявил о выпуске Gemini 3.5 Transcribe — новейшей модели нейросети для преобразования речи в текст. По словам компании, это самая точная система распознавания речи на сегодняшний день. Она способна обрабатывать более 85 языков, удалять слова-паразиты из текста и различать до трёх говорящих. Доступ к модели уже предоставлен разработчикам.
Gemini 3.5 Transcribe доступна в приложении Gemini для macOS (пока только на английском языке) и в функции голосового ввода Rambler на клавиатуре Gboard для Android в некоторых странах, включая Россию. Google отмечает, что модель демонстрирует лучшие результаты в тестах на распознавание речи по сравнению с конкурентами.
Ключевой особенностью Gemini 3.5 Transcribe является её способность к «умной» транскрибации. Модель не просто записывает речь, а понимает контекст, устраняет самокоррекции и слова-паразиты, а также автоматически форматирует текст. Она распознаёт жаргон и нестандартные выражения благодаря пользовательскому словарю. Также система поддерживает более 85 языков и может различать до трёх говорящих в одном аудиофайле.
Разработчики уже могут получить доступ к модели через Gemini API в Google AI Studio и на платформе Google Antigravity. Для корпоративных пользователей доступна Gemini Enterprise Agent Platform. Google также планирует интегрировать Gemini 3.5 Transcribe в браузер Chrome, что позволит пользователям диктовать текст голосом в любом веб-интерфейсе.
Источник: Новости Google