10.08.2026
Оператор на складе открывает карточку приёма товара в 1С. Вместо того чтобы печатать «Бутылка Кола 0,5 л × 24 шт», он говорит это вслух — и система распознаёт текст, расставляет знаки препинания и подставляет результат в поле. Весь процесс занимает около 3 секунд.
Это не демонстрация из будущего. Это то, что мы строим для своих клиентов — 50+ компаний в торговле, логистике и складской автоматизации. И почти у всех одна проблема: люди не любят вводить данные вручную. А голосом это делается за секунды.
Облачные сервисы распознавания речи — Yandex SpeechKit, Sber SaluteSpeech, Nexara — работают хорошо. Но для бизнес-задач у них есть три критических недостатка:
Голосовые записи операторов, телефонные звонки с клиентами, складские инструкции — всё это отправляется на сервера провайдера. Для компаний, работающих с персональными данными (152-ФЗ) и коммерческой тайной, это неприемлемо.
Облачные модели обучены на общих текстах. Они плохо распознают складские коды, артикулы, специфические названия товаров и сокращения, которые используют операторы 1С каждый день.
Если интернет пропал — оператор не может работать. Локальное решение работает автономно, без внешних сервисов.
Итог: Yandex SpeechKit + 1С через HTTP-сервис технически возможен. Но ни один конкурент не предлагает готового локального решения с предустановленной 1С-интеграцией и адаптацией под складскую терминологию.
Smart STT Pipeline v3 состоит из трёх шагов, которые выполняются последовательно на сервере клиента:
В системе два STT-движка — GigaAM-v2 (от Sber) и T-one (от Т-Банк). Система автоматически определяет длину голосового сообщения и выбирает оптимальный движок:
| Движок | Для чего | Время ответа |
|---|---|---|
| GigaAM-v2 | Короткие фразы до 10 секунд (складские коды, артикулы) | ~1,5 сек |
| T-one | Длинные сообщения (инструкции, звонки) | ~0,7 сек |
Если основной движок недоступен — система автоматически переключается на резервный.
STT-движки выдают «поток слов» без знаков:
брат кола триста пятьдесят пять миллилитров двадцать четыре штуки на полку семь
Брат Кола 355 мл, 24 шт — на полку семь.
Локальная LLM Qwen3.5-4B расставляет знаки препинания с точностью более 95% (F1 на внутреннем корпусе из 200 часов записей). Система развёрнута на двух серверах для надёжности.
Распознанный текст передаётся в 1С через её API — заполняет поля, создаёт документы или сохраняет транскрипцию звонка. Всё это происходит на сервере клиента, без отправки данных наружу.
Мы тестируем систему на внутреннем корпусе из 200 часов записей (складская речь, телефония, чистая речь). Вот что получаем:
| Параметр | Значение | Условия |
|---|---|---|
| Время обработки короткого аудио | ~3 сек (STT + пунктуация) | Аудио до 10 сек, чистая речь |
| Время обработки длинного аудио | ~2,2 сек | Аудио от 10 сек |
| WER (чёткая речь) | < 10% | Внутренний корпус, 200 часов |
| WER (телефония) | < 18% | Внутренний корпус, телефонные записи |
| Точность пунктуации (F1) | > 95% | Внутренний корпус, 200 часов |
| Поддерживаемые форматы | OGG, WAV, MP3 | — |
Как мы тестируем: WER считается по методике, принятой в NLP-индустрии (сравнение с ручной разметкой). Тестовый корпус — 200 часов записей с реальных складов и колл-центров наших клиентов. Оборудование: 2× RTX 5060 Ti 16 ГБ (одна карта для STT, вторая для LLM), 512 ГБ RAM.
На рынке есть несколько открытых STT-движков. Мы выбрали GigaAM-v2 и T-one после сравнительного тестирования на русском языке:
| Движок | WER на русском | Размер модели | Комментарий |
|---|---|---|---|
| GigaAM-v2 (Sber) | < 10% | 444 МБ | Лучший для коротких фраз, оптимизирован под русский |
| T-one (Т-Банк) | < 9% | 5,4 ГБ | Лучший для длинных сообщений и телефонии |
| Whisper (OpenAI) | < 12% | от 1,5 ГБ | Хорош для английского, на русском проигрывает GigaAM и T-one |
| Vosk | < 15% | от 400 МБ | Лёгкий, но значимо уступает по точности на русском |
Почему два движка: GigaAM быстрее для коротких фраз (складские коды, артикулы), T-one точнее для длинных сообщений (инструкции, звонки). Smart Router автоматически выбирает оптимальный вариант.
Главное преимущество локального развёртывания — данные не покидают инфраструктуру клиента:
Примечание: Мы не проводили аудит по 152-ФЗ и не предоставляем сертификаты соответствия. Для полной юридической защиты рекомендуем провести независимую оценку безопасности вашей ИТ-инфраструктуры.
Мы не скрываем, где система пока не справляется. Честность важна для принятия решений:
| Параметр | Yandex SpeechKit | Sber SaluteSpeech | STT Pipeline v3 |
|---|---|---|---|
| Развёртывание | Облачный API | Облачный API | Локально на сервере клиента |
| WER (чистая речь) | ~9% | < 10% | < 10%* |
| Складская терминология | ❌ | ❌ | ✅ Адаптирована |
| Работа без интернета | ❌ | ❌ | ✅ |
| 152-ФЗ | ⚠️ Облако РФ | ⚠️ Облако РФ | ✅ Локально |
| 1С-интеграция | ❌ | ❌ | ✅ Готовый модуль |
* WER на внутреннем корпусе из 200 часов записей. Облачные сервисы могут показывать лучшие результаты на стандартных датасетах (Golos, Sova), но без адаптации под складскую речь они уступают.
Мы не планируем на 12 месяцев вперёд — это внутренний план. Вот что ждёт систему в ближайшем будущем:
Результат будет появляться прямо во время речи, а не после окончания записи. Задержка — менее 500 мс. Это позволит оператору видеть результат в реальном времени и исправлять ошибки на лету.
Собираем корпус русскоязычных аудиоданных: телефония, подкасты, интервью, 1С-терминология, складские коды. Цель — снизить WER до 8% для чёткой речи и до 15% для телефонии.
Система будет автоматически определять, кто из нескольких собеседников говорит. Это важно для колл-центров: оператор и клиент — разные спикеры, и транскрипция должна это отражать.
Личный кабинет для мониторинга системы: статистика, история транскрипций, управление настройками. API для интеграции с любыми системами, не только 1С.
Голосовой ввод в 1С — это не просто удобство. Это измеримая экономия:
Наше уникальное преимущество — готовое локальное решение с предустановленной 1С-интеграцией и адаптацией под складскую терминологию. Не облачный API, который нужно подключать вручную, а система «из коробки», которая понимает ваш язык.
Smart STT Pipeline v3 — это не абстрактный проект. Это система, которая уже работает и обрабатывает голосовые сообщения в реальном времени. Мы готовы показать демо и обсудить, как она может работать для вашей компании.