Голосовые роботы в Беларуси часто спотыкаются на одних и тех же вещах: коверкают фамилии вроде «Шуст» или «Деркач», не понимают города («Жабинка», «Хойники»), путают сокращения («д. 12, кв. 5») и просят повторить по три раза. Причина не в плохой связи — причина в том, что стандартные языковые модели собраны на чужих корпусах и не знают локальную речь. В этой статье разберём, как собрать обучающий набор под белорусский контекст, какие слова собирать в первую очередь и как проверить, что робот стал понимать клиентов, а не просто кивать.
Почему стандартный ИИ-агент «не слышит» белорусскую речь
Готовые модели распознавания речи учатся на больших массивах аудио. Чем больше в корпусе жителей Минска, Гомеля, Гродно, Бреста, Витебска, Могилёва с их особенностями произношения, тем точнее робот. Но в открытых датасетах белорусский узус занимает доли процента, и модель знает белорусский примерно так, как иностранец, выучивший русский по учебнику. Отсюда типичные провалы:
- Имена и отчества с непривычными ударениями и окончаниями: «Геннадьевна», «Францевич», «Станиславовна». Робот слышит «Генадьевна» и записывает в CRM как «Геннадьевна Г.» — потом менеджер не может найти клиента в базе.
- Топонимы малых городов и деревень. «Калинковичи», «Петриков», «Вилейка», «Брагин» часто превращаются в «Калин ковичи», «Петриковка», «Вилейка — это что?».
- Сокращения в адресах и номерах документов: «ул. К. Маркса, д. 12а, кв. 5», «паспорт АВ 1234567». Точки, буквы, дефисы и пробелы в устной речи звучат как сплошной поток.
- Смесь языков. Клиент говорит на русском, вставляет белорусское слово или название, переключается обратно. Модель, обученная только на одном языке, теряет нить.
Это не особенность конкретного сервиса — это системная проблема любой модели, которая не дообучалась на местных данных. Без локального корпуса робот угадывает, а не понимает, и процент ошибок растёт именно там, где клиент хочет решить вопрос быстро: на входящей линии поддержки, при записи на услугу, в момент подтверждения заказа.
Что именно собирать для дообучения модели
Дообучение распознавания речи требует двух вещей: аудио с расшифровкой и текстовых словарей с правильными написаниями. И то и другое проще собрать, чем кажется.
Аудио: что записывать и сколько
Лучший источник — записи реальных звонков вашего колл-центра, обезличенные и с согласия клиента. Для модели на одного оператора хватит 30–50 часов расшифрованных разговоров, для устойчивого результата на целый регион — от 200 часов. Чем разнообразнее голоса, тем лучше: женщины и мужчины, пожилые и молодые, жители Минска и областных центров, ускоренная речь и медленная, шумный офис и тихая квартира. Без расшифровки запись бесполезна — модели нужно видеть пару «аудио → точный текст».
Разметка — самая трудоёмкая часть. Делегируйте её двум людям и сверяйте результат: одно и то же слово разные разметчики часто записывают по-разному, и эти расхождения показывают, какие слова в корпусе самые проблемные. Среди таких слов с высокой вероятностью окажутся фамилии, названия деревень и торговых марок.
Словари и правила нормализации
Собранные аудио не спасут, если модель не знает, что «Шуст» — это фамилия, а не звук. Параллельно с аудио соберите текстовые списки:
- Топ-200 белорусских фамилий и их склонения: отдельно мужские, отдельно женские, отдельно окончания на -ич/-евич/-овна/-евна.
- Все города из вашей зоны обслуживания: Мозырь, Барановичи, Полоцк, Калинковичи, Вилейка, Хойники, Брагин, Петриков — плюс районы и сельсоветы, если работаете с ними.
- Устойчивые сокращения: «д.», «кв.», «корп.», «стр.», «оф.» и их устные эквиваленты — «двенадцать а», «корпус два».
- Список ваших услуг и продуктов, написанных так, как их произносят клиенты. Клиент говорит «ваш токамак», а в CRM товар записан как «ТОКАМАК-2М».
- Специфические слова вашей отрасли — в медицине это названия процедур и анализов, в логистике — названия маршрутов и складов.
Словари подключаются к модели как «подсказки при распознавании» (language model biasing в терминах распознавания речи). Они не обучают модель заново, а говорят ей: «в этом контексте с большей вероятностью звучало именно это слово». Эффект заметен сразу — точность по «вашим» словам вырастает на 15–40%, по замерам разработчиков речевых платформ.
Как проверить, что обучение сработало
Не полагайтесь на ощущения операторов. Сделайте замер до и после: соберите 200–300 звонков, разметьте вручную, посчитайте долю правильно распознанных слов (WER — word error rate). Один процент ошибок — это много: при разговоре длиной в минуту это шесть слов, из которых одно распознано с ошибкой. Клиент начнёт переспрашивать и раздражаться, а вы получите негатив в отчёте по качеству обслуживания.
Сравните по слоям:
| Слой речи | Что проверять | Как измерять |
|---|---|---|
| Имена и фамилии | Совпадение с CRM-карточкой клиента | Доля звонков, где имя записано без ошибок |
| Адреса и топонимы | Совпадение с почтовым справочником | Доля адресов, прошедших геокодирование без правок |
| Числа и суммы | Совпадение с итогом заказа | Доля заказов, где сумма подтверждена с первого раза |
| Сокращения | Распознавание формата «д.», «кв.», «корп.» | Доля полей адреса, заполненных без уточнений |
Среди прочих показателей качества работы колл-центра — средняя длительность разговора, процент пропущенных обращений и доля решённых с первого звонка вопросов (FCR). Все они чувствительны к ошибкам распознавания: робот переспрашивает — разговор удлиняется, клиент бросает трубку — растёт доля пропущенных, клиент возвращается с тем же вопросом — падает FCR (по данным блога Rechka, оценивать качество только по одной метрике нельзя — оператор может быстро обрабатывать звонки, но не решать проблемы).
Типичные ошибки при обучении ИИ-агента под белорусскую речь
- Собрали только Минск. Модель отлично понимает минчан, но спотыкается на акценте Гродно или Витебска. Расширяйте географию сразу, даже если сейчас работаете только в столице.
- Использовали синтетическую речь. Сгенерированные голосом фразы звучат чище, чем живой человек, и модель учится на стерильных примерах. Реальные звонки — единственный надёжный корпус.
- Забыли про шум. Без фоновых звуков (дети, телевизор, улица) модель в продакшене сразу просядет. Записывайте разнообразие условий.
- Словарь составили, но не обновили. Меняются улицы, открываются новые торговые центры, клиенты придумывают новые сокращения. Раз в квартал пересматривайте списки.
- Оценили по офису, а не по реальным звонкам. Демо на стенде и реальный поток клиентов — две разные истории. Тестируйте на боевом трафике.
Когда робот перестаёт путать «Хойники» с «Койники», а «двенадцать а» с «двенадцать буква а», операторы перестают тратить время на переспрашивания и занимаются тем, ради чего их наняли. Если ваш бизнес в Беларуси растёт и клиенты говорят по-разному, дообучение модели под местную речь — не опция, а необходимость. Начните с того, что обезличьте записи звонков за последний месяц, попросите разметчиков выделить 200 слов, в которых робот ошибся чаще всего, и составьте словарь. Это первый шаг, который можно сделать на этой неделе.
3 шага, которые можно сделать на этой неделе:
- Выгрузите 50 последних звонков, обезличьте и отдайте двум разметчикам — путесь посчитают ошибки распознавания по слоям (имена, адреса, числа, сокращения).
- Составьте словарь на 300–500 слов: топ-200 фамилий клиентов из вашей CRM, города из зоны обслуживания, форматы адресов и сокращений, названия ваших услуг и продуктов.
- Подключите словарь к модели как подсказку и замерьте WER на тех же 50 звонках — сравните до и после, чтобы понять, какой эффект дал именно этот шаг.



