Это технологии, позволяющие компьютерам понимать, анализировать, генерировать, изменять человеческую речь. Мы учим машины воспроизводить то, что люди делают интуитивно: слышать, распознавать слова, улавливать интонации и говорить в ответ.
Здесь есть два главных направления. Первое — распознавание речи. Система слушает аудио и превращает его в текст, работая как умный помощник, который расставляет знаки препинания, распознаёт имена собственные, улавливает эмоциональную окраску. Второе — синтез речи, здесь всё наоборот. Вы даёте системе текст, а она озвучивает его естественным способом: ИИ управляет интонацией, делает паузы, ставит ударения.
Такие технологии уже используются повсюду: голосовые ассистенты в смартфонах, системы автоматического перевода, приложения для озвучки книг.