MWS AI открыла собственный инструмент для оценки моделей распознавания речи

fgfg Picture

MWS AI выложила в открытый доступ RESON (Research Engine for Speech Observation & Notes) — инструмент для комплексной оценки качества моделей автоматического распознавания речи (ASR). Он позволяет сравнивать модели по более чем 10 метрикам и автоматически формирует интерактивный HTML-отчёт с результатами анализа. RESON стал первой открытой разработкой MWS AI в области распознавания речи.

Чтобы проанализировать качество модели с помощью RESON, пользователю необходимо загрузить результаты распознавания модели и эталонные расшифровки. Инструмент позволяет привести тексты к единым правилам, чтобы некритичные различия в написании слов не влияли на итоговую оценку качества, а также проводит анализ по выбранным метрикам и сравнивает результаты.  На выходе формируется интерактивный отчёт, который открывается в формате веб-страницы. Его можно использовать для технического анализа и для наглядного представления результатов бизнес-команде.


Фрагмент обзора из одиночного отчета

RESON поддерживает более 10 метрик, которые можно настраивать под свои задачи. В числе доступных, например:

  • WER (Word Error Rate) — показывает количество ошибок при распознавании слов;
  • CER (Character Error Rate) — рассчитывает ошибки на уровне отдельных символов;
  • MWA (Mean Word Accuracy) — даёт каждому уникальному слову одинаковый вес и помогает заметить ошибки на словах, которые редко встречаются в данных, например названиях компаний, продуктов или сервисов.
  • WIS (Word Importance Score) — разработанный MWS AI показатель, который помогает находить слова, которые почти не влияют на общий результат, но важны для конкретного сценария — например название брендов и продуктов, англицизмы. Он учитывает, как часто встречается слово, насколько плохо оно распознаётся, какие ошибки возникают и на какие варианты модель его заменяет. Это позволяет, в частности, приоритизировать улучшения модели в отраслевых сценариях.

RESON доступен в формате открытой Python-библиотеки. Его можно встроить в существующие процессы разработки через командную строку или Python API и развернуть в собственной инфраструктуре компании, в том числе в закрытом контуре. Инструмент рассчитан на команды, которые сравнивают разные версии моделей и на компании, выбирающие между решениями разных разработчиков.

Новый открытый бенчмарк для оценки моделей MWS RESON ASR OSD 

Вместе с RESON MWS AI опубликовала MWS RESON ASR OSD — открытый бенчмарк (набор данных и правил для сравнения моделей в одинаковых условиях) с готовыми русскоязычными аудиоданными для оценки качества моделей распознавания речи. Он включает более 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов и ориентирован в том числе на сценарии голосовой связи и контакт-центров.

В бенчмарке представлены два типа данных: разговорная речь и фразы с числами и числовыми последовательностями. В него входят обращения в поддержку, автоматические уведомления и бытовые звонки, а также телефонные номера, счета, даты, суммы и другие данные. Записи представлены как без выраженных помех, так и с акустическим шумом и фоновой речью — например, звуками телевизора или посторонними голосами. В данных также встречаются англицизмы и названия компаний, банков, операторов связи, цифровых сервисов, устройств и приложений.

В рамках публикации бенчмарка MWS AI провела замеры качества открытых моделей Сбера, Alpha Cephei, Nvidia и OpenAI. Модели сравнивали по WER — показателю, который отражает количество ошибок при распознавании слов. Среди моделей, протестированных на всех четырёх наборах данных, лучший средний результат показала GigaAM v3 от Сбера: средний WER составил 7,42%. У Vosk показатель составил 11,07%, у Nvidia Parakeet — 15,83%, у Nvidia Nemotron — 25,52%. GigaAM допускала более чем вдвое меньше ошибок, чем Nvidia Parakeet, и более чем втрое меньше, чем Nvidia Nemotron. На втором месте по точности другая российская разработка – Vosk от Alpha Cephei.

«RESON изначально создавался для внутренних задач команды. Раньше оценка качества фактически собиралась из нескольких инструментов: отдельно считались метрики, отдельно разбирались ошибки, а результаты приходилось сводить вручную. RESON объединил этот процесс в одной системе — от подготовки данных до сравнения моделей и разбора конкретных ошибок. Анализ, который раньше мог занимать несколько часов, сократился до 10–15 минут. Сейчас мы открываем этот подход индустрии — это наш вклад в формирование общего подхода к оценке ASR-моделей, как минимум на русскоязычных данных», — отмечает руководитель команды распознавания речи MWS AI Александр Шевченко.

История о работе над RESON и его возможностях — на Habr: https://habr.com/ru/companies/mts_ai/articles/1088946/?ysclid=mupd4x9cyk415072296

Библиотека RESON на GitHub: https://github.com/mts-ai/RESON

Данные бенчмарка MWS RESON ASR OSD на Hugging Face: https://huggingface.co/datasets/MTSAIR/mws-reson-asr-osd

Новости
Главное за последнее время
Смотреть все
Технологии
MWS AI выпустила модуль для создания ИИ-агентов по текстовому описанию
Новости команды
MWS AI открыла собственный инструмент для оценки моделей распознавания речи
Решения
MWS AI выпустила ИИ-агента для анализа клиентских коммуникаций
Технологии
MWS AI выпустила песочницу и конструктор интерфейсов для ИИ-агентов
Технологии
MWS AI выпустила ИИ-модель Cotype Pro 3 для многошаговых агентских задач
Кейсы
MWS AI и РГБ создают ИИ-платформу для автоматизации библиотечной отрасли
Партнерства
Naumen и MWS AI договорились о сотрудничестве в сфере искусственного интеллекта
Партнерства
РЖД – Цифровые пассажирские решения и MWS AI будут развивать совместные решения на базе ИИ
Технологии
В России создали открытую библиотеку для автоматического обучения ИИ-моделей
Технологии
MWS AI выпустила «виртуального HR-специалиста» — мультиагентную систему для найма и управления персоналом