Голосовые AI-агенты
Голосовой AI-агент, который сам звонит клиентам и принимает входящие — живым голосом, 24/7. Обзвон базы, приём заявок, запись на услугу, квалификация лидов — вместо оператора или в помощь ему.
Что входит в услугу голосовых агентов
Мы проектируем и собираем голосового AI-агента, который сам обзванивает базу и принимает входящие звонки по вашему сценарию. В работу входит написание диалоговых сценариев и логики ветвлений, подбор и настройка движков распознавания и синтеза речи, подключение к телефонии через SIP и интеграция с вашей CRM или базой контактов. Само оборудование связи, телефонные линии и серверы остаются вашими или провайдера — мы пишем программную часть, настраиваем её под ваши номера и каналы и доводим до боевого состояния. Отдельно прорабатываем обработку отказов: что агент говорит при недозвоне, переводе на оператора или нераспознанном ответе. На выходе вы получаете настроенный голосовой контур с логами разговоров и метриками дозвона, а не абстрактную демку.
Как агент слышит и говорит
По сути голосовой агент — это связка из четырёх блоков, работающих в реальном времени. Входящий звук с линии идёт в модуль распознавания речи (STT), который превращает слова собеседника в текст, дальше языковая модель (LLM) по сценарию решает, что ответить, а синтез речи (TTS) озвучивает ответ обратно в линию. Всё это проходит через SIP-телефонию, которая держит само соединение и передаёт аудиопоток между абонентом и системой. Критична задержка на полный цикл: если ответ приходит позже секунды-полутора, разговор ощущается как разговор с роботом, поэтому блоки подбираются и настраиваются под минимальный отклик. Мы собираем эту цепочку на инфраструктуре клиента или провайдера и калибруем каждый стык, а не просто соединяем готовые сервисы наугад.
Откуда выросла технология речи
Машинный синтез речи отсчитывают от Voder — устройства, которое Гомер Дадли и его команда в Bell Labs показали на Всемирной выставке 1939 года; оно выросло из работ Дадли над вокодером, шедших с 1926 года. Распознавание появилось позже: в 1952 году те же Bell Labs построили систему Audrey, различавшую произнесённые цифры по формантам, а в 1962 году IBM показала Shoebox, понимавшую 16 слов. В 1970-е годы программа DARPA (1971–1976) привела к системе HARPY из Университета Карнеги — Меллона, которая в 1976 году распознавала уже около тысячи слов за счёт алгоритма лучевого поиска. Эти ранние машины работали с крошечным словарём, но доказали, что компьютер в принципе способен и слышать, и говорить. Современный голосовой AI-агент — прямое продолжение этой линии, только словарь и качество выросли на порядки.
Почему решает софт и настройка
Железо для звонка одинаково доступно всем, а разницу в результате даёт именно программная часть: сценарий, точность распознавания и качество голоса. Если STT путает «да» и «нет» или теряет числа, агент уводит разговор не туда, и никакая телефония это не исправит — ошибка рождается в софте и в его настройке под вашу лексику, акценты и шум на линии. Синтез тоже не нейтрален: неестественная или рваная речь заставляет людей бросать трубку в первые секунды, поэтому голос подбирается и тюнингуется под задачу, а не ставится по умолчанию. Сценарий должен закрывать реальные ветки разговора, включая перебивания, паузы и нестандартные ответы, иначе агент ломается на первом же живом диалоге. Мы относимся к этому как к инженерной задаче: измеряем долю верных распознаваний и доводимость звонка, а не верим демонстрации на чистом студийном голосе.
На каких инструментах мы работаем
Стек голосового агента строится на четырёх компонентах, и каждый мы подбираем под язык, бюджет и нагрузку клиента. STT отвечает за перевод речи в текст и настраивается под нужные языки, отраслевые термины и телефонное качество звука. TTS синтезирует ответ голосом, который выбирается под аудиторию и проверяется на естественность и разборчивость в линии. SIP-телефония связывает агента с реальными номерами и операторами, обеспечивает приём и инициацию звонков и стыкуется с вашей АТС или провайдером. LLM держит логику диалога поверх сценария — понимает намерение собеседника и формулирует ответы в рамках заданных правил. Конкретные движки в каждом блоке заменяемы, и мы выбираем сочетание по задержке, цене за минуту и точности на вашем материале, а инфраструктуру настраиваем на стороне клиента.
Когда появились ключевые стандарты
Первую полноценную систему синтеза речи по тексту для английского собрала команда Норико Умэды в японской Электротехнической лаборатории в 1968 году. Коммерческий перелом дал DECtalk компании Digital Equipment Corporation в 1984 году — именно его узнаваемым голосом долгие годы говорил Стивен Хокинг. Нейросетевая эпоха синтеза началась в 2016 году с WaveNet от DeepMind, который впервые генерировал звуковую волну напрямую и задал планку естественности нынешних голосов; распознавание перешло на нейросети раньше, опираясь в том числе на LSTM Хохрайтера и Шмидхубера 1997 года. Телефонную основу задал протокол SIP: первая версия вышла как RFC 2543 в 1999 году, а действующая редакция RFC 3261 — в июне 2002 года. На этих опорных датах и стоит вся современная голосовая телефония с искусственным интеллектом.
Почему это можно доверить нам
Суммарный опыт нашей команды разработки в IT превышает 45 лет, и голосовой контур мы собираем как инженеры, а не как продавцы готовых коробок. Мы не производим железо и честно об этом говорим: ваши линии и оборудование остаются вашими, наша зона ответственности — сценарий, распознавание, синтез, SIP-интеграция и настройка под ваши реальные звонки. Перед боевым запуском система проходит проверку на живых диалогах: мы замеряем точность распознавания, доводимость звонка и поведение агента на нестандартных ответах, и правим до того, как он наберёт первого клиента. Логи и метрики открыты, поэтому видно, где агент работает, а где сценарий надо дорабатывать. Такой подход снимает главный риск голосового AI-агента — запуск вслепую, который роняет конверсию и репутацию на первых же сотнях звонков.
Что входит
Как работаем
Агент держит 100% звонков и сам обзванивает базу — операторы разгружены, заявки не теряются ночью и в пик.
Вопросы и ответы
Это робот-автоответчик?+
Нет — AI-агент ведёт живой диалог голосом, понимает ответы и реагирует, а не читает меню.
Куда попадают заявки?+
В вашу CRM с текстовой расшифровкой каждого разговора.