
Google анонсувала Gemini 3.5 Transcribe – модель штучного інтелекту, яка спеціалізується на розпізнаванні голосу та перетворенні його на текст. Вона підтримує понад 85 мов і може самостійно наводити лад у хаотичному усному мовленні, формуючи з нього структурований текст.
Читайте також"100% коду в моїй компанії пише ШІ. Працюємо в секретному режимі" – екстопменеджер monday.com
Модель також прибирає слова-паразити, розуміє специфічні терміни та незвичні написання. Вона може працювати з номерами й іншими комбінаціями літер і цифр. Під час аналізу готових аудіозаписів Gemini 3.5 Transcribe здатна розрізняти до трьох спікерів і визначати час, коли було сказано кожне слово.
Нова технологія вже використовується у функції Rambler на смартфонах Pixel 11 та в Gemini для macOS. Google планує додати її до Search Live, Gemini Live, Google Docs, Keep і Gmail. Розробники також зможуть отримати доступ до моделі через API.
Ще одна можливість з’явиться у браузері Chrome. Користувачі зможуть диктувати текст у будь-якому текстовому полі на сайті, наприклад, писати повідомлення, публікації або давати Gemini голосові команди.
- Нагадаємо, що в Україні створили ШІ-сервіс для розпізнавання рукописів. За даними розробників, під час тестування Rukopys OCR показав кращий результат, ніж Gemini-3 Flash.
- У липні 2026 року Google перейменувала NotebookLM на Gemini Notebook. Ребрендинг відбувся після того, як у квітні NotebookLM інтегрували до застосунку Gemini.