Google zaprezentował model AI Gemini 3.5 Transcribe do transkrypcji audio — The Verge
Google zaktualizował linię Gemini Audio i zaprezentował nowy model Gemini 3.5 Transcribe do transkrypcji audio. Ma on automatycznie rozpoznawać specjalistyczną terminologię i ponad 85 języków, formatować tekst oraz usuwać słowa-wypełniacze, takie jak „eee” i „hmm” — informuje The Verge.
Możliwości nowego modelu
Google oświadczył, że Gemini 3.5 Transcribe stanowi istotny krok naprzód w porównaniu z wcześniejszym modelem transkrypcji Chirp 3, zwłaszcza pod względem pracy wielojęzycznej i liczby błędów w słowach. Użytkownicy mogą dodawać własny słownik, aby model prawidłowo uwzględniał szczególną pisownię słów i profesjonalny żargon bez dalszej ręcznej edycji.
Model może również przypisywać wypowiedzi maksymalnie trzem mówcom w wcześniej nagranym audio oraz dodawać znaczniki czasu do każdego słowa. Według Google narzędzie umożliwia edytowanie tekstu głosem.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
Aktualizacje Gemini Live
Wraz z Transcribe firma uruchamia Gemini 3.5 Live oraz Gemini 3.5 Live Experimental. Modele te rozwijają technologię rozpoznawania mowy wykorzystywaną w trybie głosowym Gemini. Gemini 3.5 Live ma lepiej obsługiwać przerwania w środku frazy, rozpoznawać języki i pracować z informacjami wizualnymi w czasie rzeczywistym.
Eksperymentalna wersja Gemini 3.5 Live, zgodnie z opisem Google, może krok po kroku głosowo objaśniać proces wykonywania bardziej złożonych zadań związanych z rozumowaniem. Nowe możliwości zaczęto wdrażać w języku angielskim dla użytkowników aplikacji Gemini na macOS, a także dla funkcji dyktowania Rambler na Androidzie w wybranych krajach i językach.
Dla deweloperów modele są dostępne w formie publicznego podglądu za pośrednictwem Gemini API w AI Studio i Antigravity. Google obiecał dodać obsługę Chrome w najbliższym czasie.
Czytaj nas na Telegram i Sends