Как обучить ИИ-агента понимать белорусские имена, топонимы и сокращения в речи клиентов

Как обучить ИИ-агента понимать белорусские имена, топонимы и сокращения в речи клиентов

Голосовые роботы в Беларуси часто спотыкаются на одних и тех же вещах: коверкают фамилии вроде «Шуст» или «Деркач», не понимают города («Жабинка», «Хойники»), путают сокращения («д. 12, кв. 5») и просят повторить по три раза. Причина не в плохой связи — причина в том, что стандартные языковые модели собраны на чужих корпусах и не знают локальную речь. В этой статье разберём, как собрать обучающий набор под белорусский контекст, какие слова собирать в первую очередь и как проверить, что робот стал понимать клиентов, а не просто кивать.

Почему стандартный ИИ-агент «не слышит» белорусскую речь

Готовые модели распознавания речи учатся на больших массивах аудио. Чем больше в корпусе жителей Минска, Гомеля, Гродно, Бреста, Витебска, Могилёва с их особенностями произношения, тем точнее робот. Но в открытых датасетах белорусский узус занимает доли процента, и модель знает белорусский примерно так, как иностранец, выучивший русский по учебнику. Отсюда типичные провалы:

  • Имена и отчества с непривычными ударениями и окончаниями: «Геннадьевна», «Францевич», «Станиславовна». Робот слышит «Генадьевна» и записывает в CRM как «Геннадьевна Г.» — потом менеджер не может найти клиента в базе.
  • Топонимы малых городов и деревень. «Калинковичи», «Петриков», «Вилейка», «Брагин» часто превращаются в «Калин ковичи», «Петриковка», «Вилейка — это что?».
  • Сокращения в адресах и номерах документов: «ул. К. Маркса, д. 12а, кв. 5», «паспорт АВ 1234567». Точки, буквы, дефисы и пробелы в устной речи звучат как сплошной поток.
  • Смесь языков. Клиент говорит на русском, вставляет белорусское слово или название, переключается обратно. Модель, обученная только на одном языке, теряет нить.

Это не особенность конкретного сервиса — это системная проблема любой модели, которая не дообучалась на местных данных. Без локального корпуса робот угадывает, а не понимает, и процент ошибок растёт именно там, где клиент хочет решить вопрос быстро: на входящей линии поддержки, при записи на услугу, в момент подтверждения заказа.

Что именно собирать для дообучения модели

Дообучение распознавания речи требует двух вещей: аудио с расшифровкой и текстовых словарей с правильными написаниями. И то и другое проще собрать, чем кажется.

Аудио: что записывать и сколько

Лучший источник — записи реальных звонков вашего колл-центра, обезличенные и с согласия клиента. Для модели на одного оператора хватит 30–50 часов расшифрованных разговоров, для устойчивого результата на целый регион — от 200 часов. Чем разнообразнее голоса, тем лучше: женщины и мужчины, пожилые и молодые, жители Минска и областных центров, ускоренная речь и медленная, шумный офис и тихая квартира. Без расшифровки запись бесполезна — модели нужно видеть пару «аудио → точный текст».

Разметка — самая трудоёмкая часть. Делегируйте её двум людям и сверяйте результат: одно и то же слово разные разметчики часто записывают по-разному, и эти расхождения показывают, какие слова в корпусе самые проблемные. Среди таких слов с высокой вероятностью окажутся фамилии, названия деревень и торговых марок.

Словари и правила нормализации

Собранные аудио не спасут, если модель не знает, что «Шуст» — это фамилия, а не звук. Параллельно с аудио соберите текстовые списки:

  • Топ-200 белорусских фамилий и их склонения: отдельно мужские, отдельно женские, отдельно окончания на -ич/-евич/-овна/-евна.
  • Все города из вашей зоны обслуживания: Мозырь, Барановичи, Полоцк, Калинковичи, Вилейка, Хойники, Брагин, Петриков — плюс районы и сельсоветы, если работаете с ними.
  • Устойчивые сокращения: «д.», «кв.», «корп.», «стр.», «оф.» и их устные эквиваленты — «двенадцать а», «корпус два».
  • Список ваших услуг и продуктов, написанных так, как их произносят клиенты. Клиент говорит «ваш токамак», а в CRM товар записан как «ТОКАМАК-2М».
  • Специфические слова вашей отрасли — в медицине это названия процедур и анализов, в логистике — названия маршрутов и складов.

Словари подключаются к модели как «подсказки при распознавании» (language model biasing в терминах распознавания речи). Они не обучают модель заново, а говорят ей: «в этом контексте с большей вероятностью звучало именно это слово». Эффект заметен сразу — точность по «вашим» словам вырастает на 15–40%, по замерам разработчиков речевых платформ.

Как проверить, что обучение сработало

Не полагайтесь на ощущения операторов. Сделайте замер до и после: соберите 200–300 звонков, разметьте вручную, посчитайте долю правильно распознанных слов (WER — word error rate). Один процент ошибок — это много: при разговоре длиной в минуту это шесть слов, из которых одно распознано с ошибкой. Клиент начнёт переспрашивать и раздражаться, а вы получите негатив в отчёте по качеству обслуживания.

Сравните по слоям:

Слой речиЧто проверятьКак измерять
Имена и фамилииСовпадение с CRM-карточкой клиентаДоля звонков, где имя записано без ошибок
Адреса и топонимыСовпадение с почтовым справочникомДоля адресов, прошедших геокодирование без правок
Числа и суммыСовпадение с итогом заказаДоля заказов, где сумма подтверждена с первого раза
СокращенияРаспознавание формата «д.», «кв.», «корп.»Доля полей адреса, заполненных без уточнений

Среди прочих показателей качества работы колл-центра — средняя длительность разговора, процент пропущенных обращений и доля решённых с первого звонка вопросов (FCR). Все они чувствительны к ошибкам распознавания: робот переспрашивает — разговор удлиняется, клиент бросает трубку — растёт доля пропущенных, клиент возвращается с тем же вопросом — падает FCR (по данным блога Rechka, оценивать качество только по одной метрике нельзя — оператор может быстро обрабатывать звонки, но не решать проблемы).

Типичные ошибки при обучении ИИ-агента под белорусскую речь

  • Собрали только Минск. Модель отлично понимает минчан, но спотыкается на акценте Гродно или Витебска. Расширяйте географию сразу, даже если сейчас работаете только в столице.
  • Использовали синтетическую речь. Сгенерированные голосом фразы звучат чище, чем живой человек, и модель учится на стерильных примерах. Реальные звонки — единственный надёжный корпус.
  • Забыли про шум. Без фоновых звуков (дети, телевизор, улица) модель в продакшене сразу просядет. Записывайте разнообразие условий.
  • Словарь составили, но не обновили. Меняются улицы, открываются новые торговые центры, клиенты придумывают новые сокращения. Раз в квартал пересматривайте списки.
  • Оценили по офису, а не по реальным звонкам. Демо на стенде и реальный поток клиентов — две разные истории. Тестируйте на боевом трафике.

Когда робот перестаёт путать «Хойники» с «Койники», а «двенадцать а» с «двенадцать буква а», операторы перестают тратить время на переспрашивания и занимаются тем, ради чего их наняли. Если ваш бизнес в Беларуси растёт и клиенты говорят по-разному, дообучение модели под местную речь — не опция, а необходимость. Начните с того, что обезличьте записи звонков за последний месяц, попросите разметчиков выделить 200 слов, в которых робот ошибся чаще всего, и составьте словарь. Это первый шаг, который можно сделать на этой неделе.

3 шага, которые можно сделать на этой неделе:

  1. Выгрузите 50 последних звонков, обезличьте и отдайте двум разметчикам — путесь посчитают ошибки распознавания по слоям (имена, адреса, числа, сокращения).
  2. Составьте словарь на 300–500 слов: топ-200 фамилий клиентов из вашей CRM, города из зоны обслуживания, форматы адресов и сокращений, названия ваших услуг и продуктов.
  3. Подключите словарь к модели как подсказку и замерьте WER на тех же 50 звонках — сравните до и после, чтобы понять, какой эффект дал именно этот шаг.
Полезные ссылки как выстроить обучение операторов колл-центра в 2026 году, как изучать конкурентов через тайный звонок.