Google представила ИИ-модель Gemini 3.5 Transcribe для расшифровки аудио — The Verge
Google обновила линейку Gemini Audio и представила новую модель Gemini 3.5 Transcribe для расшифровки аудио. Она должна автоматически распознавать специализированную терминологию и более 85 языков, форматировать текст и удалять слова-паразиты вроде «э-э» и «гм», сообщает The Verge.
Возможности новой модели
В Google заявили, что Gemini 3.5 Transcribe является существенным шагом вперед по сравнению с предыдущей моделью транскрибирования Chirp 3, в частности в многоязычной работе и количестве ошибок в словах. Пользователи могут добавлять собственный словарь, чтобы модель корректно учитывала особое написание слов и профессиональный жаргон без последующего ручного редактирования.
Модель также может распределять реплики между тремя говорящими в заранее записанном аудио и добавлять временные метки для каждого слова. По данным Google, инструмент позволяет редактировать текст голосом.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Обновления Gemini Live
Вместе с Transcribe компания запускает Gemini 3.5 Live и Gemini 3.5 Live Experimental. Эти модели развивают технологию распознавания речи, используемую в голосовом режиме Gemini. Gemini 3.5 Live должна лучше обрабатывать прерывания посреди фразы, распознавать языки и работать с визуальной информацией в реальном времени.
Экспериментальная версия Gemini 3.5 Live, согласно описанию Google, может пошагово озвучивать ход выполнения более сложных задач, связанных с рассуждениями. Новые возможности начали внедрять на английском языке для пользователей приложения Gemini на macOS, а также для функции диктовки Rambler на Android в выбранных странах и языках.
Для разработчиков модели доступны в формате публичного предварительного просмотра через Gemini API в AI Studio и Antigravity. В Google пообещали добавить поддержку Chrome в ближайшее время.