← Назад в блог

Голосовой ввод в 1С за 3 секунды: как работает Smart STT Pipeline v3

10.08.2026

Оператор на складе открывает карточку приёма товара в 1С. Вместо того чтобы печатать «Бутылка Кола 0,5 л × 24 шт», он говорит это вслух — и система распознаёт текст, расставляет знаки препинания и подставляет результат в поле. Весь процесс занимает около 3 секунд.

Это не демонстрация из будущего. Это то, что мы строим для своих клиентов — 50+ компаний в торговле, логистике и складской автоматизации. И почти у всех одна проблема: люди не любят вводить данные вручную. А голосом это делается за секунды.

Почему не Yandex SpeechKit или Sber?

Облачные сервисы распознавания речи — Yandex SpeechKit, Sber SaluteSpeech, Nexara — работают хорошо. Но для бизнес-задач у них есть три критических недостатка:

Данные уходят третьим лицам

Голосовые записи операторов, телефонные звонки с клиентами, складские инструкции — всё это отправляется на сервера провайдера. Для компаний, работающих с персональными данными (152-ФЗ) и коммерческой тайной, это неприемлемо.

Не знают 1С-терминологию

Облачные модели обучены на общих текстах. Они плохо распознают складские коды, артикулы, специфические названия товаров и сокращения, которые используют операторы 1С каждый день.

Зависимость от интернета

Если интернет пропал — оператор не может работать. Локальное решение работает автономно, без внешних сервисов.

Итог: Yandex SpeechKit + 1С через HTTP-сервис технически возможен. Но ни один конкурент не предлагает готового локального решения с предустановленной 1С-интеграцией и адаптацией под складскую терминологию.

Как это работает: простой конвейер

Smart STT Pipeline v3 состоит из трёх шагов, которые выполняются последовательно на сервере клиента:

Шаг 1. Умный выбор движка

В системе два STT-движка — GigaAM-v2 (от Sber) и T-one (от Т-Банк). Система автоматически определяет длину голосового сообщения и выбирает оптимальный движок:

ДвижокДля чегоВремя ответа
GigaAM-v2Короткие фразы до 10 секунд (складские коды, артикулы)~1,5 сек
T-oneДлинные сообщения (инструкции, звонки)~0,7 сек

Если основной движок недоступен — система автоматически переключается на резервный.

Шаг 2. Расстановка знаков препинания

STT-движки выдают «поток слов» без знаков:

брат кола триста пятьдесят пять миллилитров двадцать четыре штуки на полку семь

Брат Кола 355 мл, 24 шт — на полку семь.

Локальная LLM Qwen3.5-4B расставляет знаки препинания с точностью более 95% (F1 на внутреннем корпусе из 200 часов записей). Система развёрнута на двух серверах для надёжности.

Шаг 3. Отправка в 1С

Распознанный текст передаётся в 1С через её API — заполняет поля, создаёт документы или сохраняет транскрипцию звонка. Всё это происходит на сервере клиента, без отправки данных наружу.

Реальные метрики

Мы тестируем систему на внутреннем корпусе из 200 часов записей (складская речь, телефония, чистая речь). Вот что получаем:

ПараметрЗначениеУсловия
Время обработки короткого аудио~3 сек (STT + пунктуация)Аудио до 10 сек, чистая речь
Время обработки длинного аудио~2,2 секАудио от 10 сек
WER (чёткая речь)< 10%Внутренний корпус, 200 часов
WER (телефония)< 18%Внутренний корпус, телефонные записи
Точность пунктуации (F1)> 95%Внутренний корпус, 200 часов
Поддерживаемые форматыOGG, WAV, MP3

Как мы тестируем: WER считается по методике, принятой в NLP-индустрии (сравнение с ручной разметкой). Тестовый корпус — 200 часов записей с реальных складов и колл-центров наших клиентов. Оборудование: 2× RTX 5060 Ti 16 ГБ (одна карта для STT, вторая для LLM), 512 ГБ RAM.

Почему GigaAM и T-one, а не Whisper или Vosk?

На рынке есть несколько открытых STT-движков. Мы выбрали GigaAM-v2 и T-one после сравнительного тестирования на русском языке:

ДвижокWER на русскомРазмер моделиКомментарий
GigaAM-v2 (Sber)< 10%444 МБЛучший для коротких фраз, оптимизирован под русский
T-one (Т-Банк)< 9%5,4 ГБЛучший для длинных сообщений и телефонии
Whisper (OpenAI)< 12%от 1,5 ГБХорош для английского, на русском проигрывает GigaAM и T-one
Vosk< 15%от 400 МБЛёгкий, но значимо уступает по точности на русском

Почему два движка: GigaAM быстрее для коротких фраз (складские коды, артикулы), T-one точнее для длинных сообщений (инструкции, звонки). Smart Router автоматически выбирает оптимальный вариант.

Безопасность и 152-ФЗ

Главное преимущество локального развёртывания — данные не покидают инфраструктуру клиента:

  • Аудио не уходит в облако. Все обработки — на сервере клиента. Нет отправки записей на внешние серверы.
  • Соответствие 152-ФЗ. Персональные данные операторов и клиентов обрабатываются в пределах инфраструктуры заказчика.
  • Резервное копирование. Система развёрнута на двух серверах (основной + резервный) для отказоустойчивости.

Примечание: Мы не проводили аудит по 152-ФЗ и не предоставляем сертификаты соответствия. Для полной юридической защиты рекомендуем провести независимую оценку безопасности вашей ИТ-инфраструктуры.

Ограничения системы

Мы не скрываем, где система пока не справляется. Честность важна для принятия решений:

  • Шумные помещения. На складе с работающей техникой точность снижается. Требуется шумоподавляющий микрофон.
  • Акценты и диалекты. Система обучена на стандартном русском. Сильные региональные акценты могут снижать точность.
  • Кодсмешение (русский + узбекский/таджикский). Система не оптимизирована для смешанных языковых контекстов, которые часто встречаются на складах с migrant workers.
  • Детские голоса. Система обучена на взрослых голосах. Детский голос может распознаваться хуже.

Конкурентный ландшафт

ПараметрYandex SpeechKitSber SaluteSpeechSTT Pipeline v3
РазвёртываниеОблачный APIОблачный APIЛокально на сервере клиента
WER (чистая речь)~9%< 10%< 10%*
Складская терминология✅ Адаптирована
Работа без интернета
152-ФЗ⚠️ Облако РФ⚠️ Облако РФ✅ Локально
1С-интеграция✅ Готовый модуль

* WER на внутреннем корпусе из 200 часов записей. Облачные сервисы могут показывать лучшие результаты на стандартных датасетах (Golos, Sova), но без адаптации под складскую речь они уступают.

Куда мы движемся

Мы не планируем на 12 месяцев вперёд — это внутренний план. Вот что ждёт систему в ближайшем будущем:

Потоковое распознавание

Результат будет появляться прямо во время речи, а не после окончания записи. Задержка — менее 500 мс. Это позволит оператору видеть результат в реальном времени и исправлять ошибки на лету.

Дообучение GigaAM-v3

Собираем корпус русскоязычных аудиоданных: телефония, подкасты, интервью, 1С-терминология, складские коды. Цель — снизить WER до 8% для чёткой речи и до 15% для телефонии.

Разделение говорящих (диаризация)

Система будет автоматически определять, кто из нескольких собеседников говорит. Это важно для колл-центров: оператор и клиент — разные спикеры, и транскрипция должна это отражать.

Клиентский интерфейс

Личный кабинет для мониторинга системы: статистика, история транскрипций, управление настройками. API для интеграции с любыми системами, не только 1С.

Что это значит для вашего бизнеса?

Голосовой ввод в 1С — это не просто удобство. Это измеримая экономия:

  • Скорость. Голосовой ввод в 2–3 раза быстрее клавиатурного. Оператор заполняет карточку за 5 секунд вместо 15.
  • Точность. Ошибки при ручном вводе — одна из главных причин расхождений на складе. Голосовой ввод снижает количество ошибок на 30–40%.
  • Безопасность данных. Аудио и текст обрабатываются на сервере клиента. Никаких облаков, никаких третьих лиц.
  • Адаптация. Система понимает складскую терминологию, артикулы и коды — не нужно настраивать и обучать с нуля.

Наше уникальное преимущество — готовое локальное решение с предустановленной 1С-интеграцией и адаптацией под складскую терминологию. Не облачный API, который нужно подключать вручную, а система «из коробки», которая понимает ваш язык.

Попробовать

Smart STT Pipeline v3 — это не абстрактный проект. Это система, которая уже работает и обрабатывает голосовые сообщения в реальном времени. Мы готовы показать демо и обсудить, как она может работать для вашей компании.