Голосовой AI в реальном мире: задержки, перебивания и другие грабли
Описание Практический разбор разработки голосового AI-оператора с архитектурой: MTT/Exolve → Asterisk → AudioSocket → STT → LLM → TTS На примере работающего проекта расскажу, как мы создавали роботов для холодного обзвона на базе локального AI и масштабировали систему до 30+ одновременных разговоров. Поговорим о том, как боролись с задержкой голоса, шумами и перебиваниями, снижали нагрузку на серверы, выбирали LLM и настраивали промты. Отдельно разберём решения, которые хорошо выглядели на бумаге, но не выдержали реальной эксплуатации, и подходы, которые сначала казались «костылями», но в итоге помогли довести проект до продакшена. Также расскажу, как полученный опыт мы использовали при создании IP-звонилки для Windows с AI-суфлёром для менеджеров продаж.
Тезисы - Архитектура голосового AI-оператора: от телефонии до STT, LLM и TTS. - Как уменьшить задержки, бороться с перебиваниями и шумами. - Как выбирать LLM и настраивать промты без потери скорости. - Как снизить нагрузку на серверы при 30+ одновременных разговорах. - Какие решения сработали в продакшене, а какие пришлось отбросить. - Почему временные «костыли» иногда оказываются лучшим практическим решением.