Главная блога

От LLM-демо к промышленному Voice AI: как Neuro.net строит инфраструктуру для голосовых ассистентов

AI-ассистент в демо и AI-ассистент в бизнесе — это разные системы

За последние годы рынок быстро привык к демонстрациям LLM и AI-ассистентов. Модель отвечает на вопросы, поддерживает диалог, помогает искать информацию, формулирует тексты и выполняет отдельные действия. В демонстрационном режиме этого часто достаточно, чтобы показать возможности технологии.

Но в реальном бизнесе требования другие.

AI-ассистент должен работать не с одним тестовым запросом, а с большим потоком обращений. Он должен быстро отвечать, выдерживать пиковую нагрузку, сохранять стабильность, обращаться к корпоративным системам и не делать стоимость сервиса непредсказуемой.

Для голосового AI это особенно важно. В текстовом интерфейсе пользователь может подождать несколько секунд. В телефонном разговоре задержка сразу ощущается как сбой: человек начинает перебивать, повторять вопрос или просить соединить с оператором.

Поэтому промышленный Voice AI начинается не только с модели. Он начинается с инфраструктуры.

Почему инфраструктура стала частью качества Voice AI

Когда пользователь разговаривает с голосовым AI-ассистентом, он слышит только готовый ответ. Но внутри за короткое время проходит целая цепочка процессов.

Система должна распознать речь, понять намерение пользователя, при необходимости обратиться к данным, запустить нужную модель, сформировать ответ и преобразовать его обратно в голос. Всё это происходит в реальном времени.

Если один из элементов работает медленно, качество диалога снижается. Даже сильная языковая модель не поможет, если ответ приходит с длинной паузой. Даже хорошо написанный сценарий не сработает, если платформа не выдерживает нагрузку или сетевые запросы идут слишком долго.

Именно поэтому для Neuro.net инфраструктура — это не вспомогательная техническая часть, а основа продуктового качества.

Платформа Neuro.net работает с виртуальными операторами, голосовыми помощниками и чат-ботами на базе технологий распознавания и синтеза речи, а также больших языковых моделей. Такие решения применяются в клиентском сервисе, продажах, HR, финтехе, медицине, образовании и госсекторе.

В каждом из этих сценариев AI должен быть не просто “умным”, а устойчивым, быстрым и управляемым.

промышленный Voice AI

Задача: обеспечить промышленную работу платформы

Перед командой Neuro.net стояла задача развивать инфраструктуру для высоконагруженной коммуникационной платформы на базе голосового AI и LLM.

Платформа должна была поддерживать большое количество одновременных голосовых сессий, быстро обрабатывать запросы, сохранять низкую задержку ответа в голосовом канале и давать возможность запускать LLM-инференс без резкого роста расходов.

Среди ключевых требований были:

  • масштабирование AI-платформы под высокие нагрузки;
  • быстрая сетевая связность между сервисами;
  • поддержка голосового канала с End-to-End latency до 1200 мс;
  • запуск open-source LLM для голосовых и текстовых ассистентов;
  • возможность распределять нагрузку между разными типами серверов;
  • контроль стоимости инфраструктуры при росте числа проектов.

Эта задача особенно важна для enterprise-сценариев. Когда AI-ассистент становится частью клиентского сервиса, продаж или HR-процесса, он должен работать как промышленная система, а не как отдельный пилот.

Решение: GPU-серверы, colocation и гибкая инфраструктура

Для размещения и масштабирования платформы Neuro.net использует инфраструктуру Selectel: выделенные серверы с GPU, облачные серверы, объектное хранилище S3 и colocation.

Платформа развернута на выделенных серверах с видеокартами NVIDIA A100, RTX 5000, RTX 6000 и T4. Также команда Neuro.net использует собственный сервер с восемью картами A100, размещённый в дата-центре Selectel.

Такой подход позволяет не привязывать все задачи к одному типу инфраструктуры. Разные компоненты платформы требуют разной мощности: распознавание речи, синтез, LLM-инференс, API, оркестрация, хранение данных и аналитика.

Гибкая инфраструктура помогает подбирать конфигурации под конкретные сценарии и распределять нагрузку между арендованными и собственными серверами. Для AI-платформы это принципиально: важно не просто использовать максимально мощное оборудование, а находить баланс между производительностью, скоростью и экономикой сервиса.

Как снизили задержки между сервисами

Платформа Neuro.net распределена между несколькими облачными провайдерами. Такая архитектура повышает отказоустойчивость, но при большом количестве межоблачных запросов может создавать лишние задержки.

Если данные постоянно передаются между разными провайдерами, увеличивается время ожидания ответа и растёт объём сетевого трафика. Для голосового канала это критично: каждая лишняя пауза влияет на восприятие диалога.

Чтобы ускорить обработку запросов, команда Neuro.net развернула в инфраструктуре Selectel единый API-слой. Он объединил несколько сервисов под одним адресом.

В результате основная логика и взаимодействие компонентов выполняются внутри инфраструктуры Selectel, а между провайдерами передаётся только минимально необходимый объём данных.

API и компоненты оркестрации размещены на облачных серверах Selectel, а данные и артефакты сохраняются в S3. Это позволило сократить межоблачный трафик, снизить задержки и ускорить обработку запросов.

Как запускается LLM-инференс

Отдельное направление — инфраструктура для open-source LLM. Для голосовых и текстовых ассистентов Neuro.net требовалась высокая скорость инференса, низкая задержка ответа, масштабируемость и контроль затрат.

Последний пункт особенно важен для бизнес-продукта. Использование самых дорогих GPU может резко повысить стоимость конечного сервиса для заказчиков. Поэтому задача состояла не в том, чтобы выбрать самое мощное оборудование любой ценой, а в том, чтобы подобрать конфигурации под разные типы нагрузки.

На выделенных GPU-серверах Neuro.net развернула open-source LLM, включая Qwen3-32B, Qwen3.5-27B, а также экспериментальные модели Llama, Gemma и DeepSeek.

Такой подход даёт команде возможность тестировать разные модели, выбирать оптимальные конфигурации и развивать LLM-функциональность без неконтролируемого роста стоимости инфраструктуры.

Что это даёт платформе

В текущей конфигурации инфраструктура Neuro.net поддерживает:

  • до 5000 одновременных голосовых каналов;
  • 600–800 запросов в секунду в пиковых сценариях;
  • до 400 одновременных ASR-сессий;
  • SLA на уровне 99,9%.

Для клиентов эти цифры важны не сами по себе. Они показывают, что платформа готова к промышленной эксплуатации: может работать с большими потоками обращений, выдерживать пиковые сценарии и сохранять стабильность сервиса.

Это особенно важно для компаний, которые используют голосовой AI не как эксперимент, а как часть операционной модели: в клиентском сервисе, продажах, HR, административных коммуникациях и других регулярных процессах.

Почему это важно для рынка AI

Сейчас многие компании обсуждают внедрение LLM и AI-ассистентов. Но по мере перехода от пилотов к промышленным проектам меняется сам вопрос.

На раннем этапе бизнес спрашивает: “Что умеет модель?”

На этапе внедрения вопрос становится другим: “Сможет ли система работать стабильно в наших процессах?”

Для Voice AI это означает, что нужно учитывать не только качество распознавания, сценарий и естественность голоса. Важны задержка ответа, сетевые маршруты, GPU-инфраструктура, оркестрация, хранение данных, мониторинг, отказоустойчивость и стоимость инференса.

Именно этот слой часто остаётся невидимым для пользователя. Но без него AI-ассистент не может стать полноценной частью бизнеса.

Комментарий Neuro.net

«За время сотрудничества Selectel зарекомендовал себя как надежный партнер, который понимает потребности высоконагруженных проектов. Нам важно, что помимо инфраструктуры мы получаем экспертизу и возможность гибко подбирать решения под текущие задачи. Такой подход помогает нам быстрее запускать новые сервисы и масштабироваться по мере роста нагрузки», — отметил Илья Спирин, ИТ-архитектор Neuro.net.

Итог

Кейс Neuro.net и Selectel показывает, что развитие Voice AI сегодня выходит за рамки демонстраций и пилотных запусков. Для бизнеса важен не только сам факт использования LLM, а способность платформы работать в реальной нагрузке: быстро отвечать, выдерживать пиковые сценарии, сохранять стабильность и контролировать стоимость.

Промышленный Voice AI — это связка моделей, голосовых технологий, инфраструктуры и инженерной архитектуры. Именно такая связка позволяет AI-ассистентам быть не экспериментом, а рабочим инструментом для клиентского сервиса, продаж, HR и других бизнес-процессов.