Google представила ШІ-модель Gemini 3.5 Transcribe для розшифрування аудіо — The Verge
Google оновила лінійку Gemini Audio та представила нову модель Gemini 3.5 Transcribe для розшифрування аудіо. Вона має автоматично розпізнавати спеціалізовану термінологію та понад 85 мов, форматувати текст і прибирати слова-паразити на кшталт «е-е» та «гм», повідомляє The Verge.
Можливості нової моделі
У Google заявили, що Gemini 3.5 Transcribe є суттєвим кроком уперед порівняно з попередньою моделлю транскрибування Chirp 3, зокрема щодо багатомовної роботи та кількості помилок у словах. Користувачі можуть додавати власний словник, щоб модель коректно враховувала особливе написання слів і професійний жаргон без подальшого ручного редагування.
Модель також може атрибутувати репліки до трьох мовців у заздалегідь записаному аудіо та додавати часові позначки для кожного слова. За даними Google, інструмент дає змогу редагувати текст голосом.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Оновлення Gemini Live
Разом із Transcribe компанія запускає Gemini 3.5 Live та Gemini 3.5 Live Experimental. Ці моделі розвивають технологію розпізнавання мовлення, що використовується в голосовому режимі Gemini. Gemini 3.5 Live має краще обробляти переривання посеред фрази, розпізнавати мови та працювати з візуальною інформацією в реальному часі.
Експериментальна версія Gemini 3.5 Live, за описом Google, може покроково озвучувати хід виконання складніших завдань, пов’язаних із міркуваннями. Нові можливості почали впроваджувати англійською мовою для користувачів застосунку Gemini на macOS, а також для функції диктування Rambler на Android у вибраних країнах і мовах.
Для розробників моделі доступні у форматі публічного попереднього перегляду через Gemini API в AI Studio та Antigravity. Підтримку Chrome у Google пообіцяли додати найближчим часом.