Голосовий ШІ ще не досяг свого моменту ChatGPT
Технології голосового штучного інтелекту, попри швидкий розвиток моделей, ще не досягли рівня прориву, який для чат-ботів стався після появи ChatGPT. Таку оцінку висловили керівники компаній PolyAI та Otter, повідомляє TechCrunch.
Технічний директор корпоративної платформи голосового ШІ PolyAI Шон Вен заявив, що галузь уже створила повнодуплексні моделі, здатні говорити й одночасно слухати співрозмовника. Наступним завданням він назвав прискорення міркувань моделей, щоб вони швидко знаходили відповіді, а розмова сприймалася природно.
За словами Вена, агенти ШІ у службах підтримки не мають звучати роботизовано. Якщо голосова система достатньо добре взаємодіє з клієнтом у перших кількох репліках, користувач може поступово повірити, що вона здатна розв’язати його проблему без залучення людини.
Директор із маркетингу сервісу нотаток для зустрічей Otter Алекс Гей зазначив, що для автоматизації важливі розпізнавання мовців, визначення намірів і поєднання тексту з організаційними знаннями. Компанія також працює над цифровими двійниками, які потенційно зможуть представляти людей на зустрічах. Для цього, на його думку, синтезований голос має передавати емоційні відтінки живої розмови.
Вен і Гей також звернули увагу на проблему неточних транскрипцій. За словами Вена, моделі автоматичного розпізнавання мовлення можуть пропускати важливі ключові слова, через що втрачається контекст. Гей пояснив, що помилка у початковій розшифровці впливає на всі подальші дії системи та підриває довіру до платформи, якщо вона виконує хибні дії.
Окремим питанням лишається прозорість використання голосових інструментів. Представники Otter і PolyAI наголосили, що люди мають знати, коли їх записують або коли вони спілкуються зі ШІ. Otter, зокрема, розглядає способи повідомляти всіх учасників чату про запис зустрічі, навіть якщо бот не бере в ній участі.
- Останні
- Популярні
Новини по днях
11 жовтня 2026