4.4. Перспективные зарубежные системы речевого общения

Из всего разнообразия зарубежных промышленных СРО рассмотрим системы, которые, на наш взгляд, являются наиболее перспективными в плане реализации в них как новых теоретических моделей, так и достигнутых показателей качества синтеза и распознавания речи.

Примером высококачественного синтезатора, с помощью которого можно воспроизвести близкую к естественной речь различного темпа и оттенков непосредственно по тексту неограниченного словаря, является устройствоDES-talk. УстройствоDES-talk(см. табл. 1.1) представляет собой блок размером 10  45  30 см, на задней панели которого расположены разъемы для подключения ЭВМ, видеотерминала и печатающего устройства, различных устройств вывода информации, в том числе телефона, индикатора на светодиодах, регулятора громкости. Высокое качество синтезатора DES-talk обусловлено большой библиотекой используемых правил, возможностью выбора словаря по желанию пользователя, качеством аппаратных средств для преобразования речи. Пользователь может выбрать семь различных голосов, в том числе стандартные женский, мужской, детский, а также низкий мужской и голос пожилого человека.

В устройстве DES-talkпроцесс преобразования текстовой информации в речевую разделяется на три уровня. На первом слова преобразуются в цифровую форму в соответствии с кодомASCIIи разбиваются на фонемы. При этом используются наборправил преобразования букв в звуки и два словаря. Один содержит 6000 слов, другой — около 150 специфических терминов, иностранных слов и аббревиатур, вводимых самим пользователем. Преобразования первого уровня начинаются с поиска эталонных слов, соответствующих вводимому орфографическому тексту, в большом словаре. Если эталоны найдены, то текст, преобразованный в фонемную форму, сразу передается на второй уровень обработки. Если эталоны не найдены ни в одном из словарей, то вводимый текст обрабатывается в соответствии с правилами преобразования букв в звуки и затем передается на второй уровень. На втором уровне производится считывание фонем, синтаксический анализ, определяются интонация, продолжительность и ударение в словах, выполняются акустические расчеты. На третьем уровне осуществляются окончательные преобразования входной текстовой информации и синтез речи. Синтезирванные цифровые сигналы передаются со скоростью не менее 120 Кбит/с в стандартный цифроаналоговый преобразователь (ЦАП). В синтезатореDES-talkиспользуются эвристические правила для оценки влияния окружающих слов на произношение, интонацию, продолжительность и ударение в данном слове.

Программное обеспечение для синтезатора DES-talkпрактически аналогично программному обеспечению для существующих алфавитно-цифровых терминалов, работающих в стандарте ASCII, за исключением модулей, определяющих формат данных.Поэтому создание программного обеспечения не вызывает трудностей, что открывает синтезатору DES-talk широкие области применения.

Создание перспективных моделей распознавания речи связано со стремлением достичь высокой надежности при работе с большими словарями (свыше 1000 слов) в режиме слитного произнесения. Наиболее близко к такому идеалу подходит системаKVS-3000, словарь которой содержит 10 000 слов, а точность распознавания 95 %. Для подготовки устройства к работе весь набор эталонных слов должен быть произнесен трижды, поэтому память устройства KVS-30 000 рассчитана на хранение 30 000 слов.Среднее время распознавания — около 500 мс.

Фирма «Verbex» (США) разработала мощную систему распознавания непрерывной речи — модельVerbex-30 000, позволяющую распознавать предложения любой длины, состоящие из отдельных или слитно произносимых слов. Эта система ориентирована на голос одного диктора, при смене диктора необходима перезапись в ОЗУ для хранения эталонов слов. МодельVerbex-30 000, построенная по архитектуре «звезды», включает 2—4 таких речевых процессора и может оперировать 120—360 словами. Каждый процессор содержит ЗУ емкостью 0,25 Мбайт для хранения данных, а также ЗУ для хранения 4000 микрокодовых инструкций, каждая длиной 64 бит. Кроме того, гибкость конструкции системы, обеспеченная развитой структурой элементов сопряжения, позволяет использовать память центральной ЭВМ. Быстродействие речевого процессора — 5 млн опер./с.

Микропроцессорная архитектура системы позволяет производить операции с высоким быстродействием, что является необходимым условием для выполнения алгоритма распознавания непрерывной речи. Процесс распознавания, который заключается в подборе последовательности эталонных слов, максимально соответствующей произнесенной пользователем, осуществляется ДП-методом. Входные речевые сигналы усиливаются, фильтруются и кодируются аудипроцессором, а затем передаются в управляющий процессор с интервалом 10 мкс. Управляющий процессор распределяет сигнал между речевыми процессорами, которые выделяют его фонетические характеристики. Разработчики системы определили, что для обеспечения точности распознавания 99 % достаточно 16 таких характеристик. Процесс распознавания в управляющем процессоре и поиск эталона производятся одновременно, т. е. когда процессор «улавливает» окончание речи.

Во избежание влияния на окончательный результат распознавания ошибок, возможных на первом этапе, система постоянно проверяет множество параллельных гипотез, сравнивая ввод данных с грамматически обозначенным набором всех нормальных произношений. Ответ задерживается до момента проверки всех гипотез и совпадения произнесенного с эталоном.

<<< < Предыдущая 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 2324 / 3024 25 26 27 28 29 30 > Следующая >>>

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]

#
16.08.201956.64 Кб7Учебник Гусейнова,ДИАЛОГ МЕНОНА,учебник василье...docx
#
06.08.20191.15 Mб8Учебник по рекламе.rtf
#
13.08.2019283.69 Кб16Учебник ТВ и МС (Частичный).docx
#
29.04.201935.06 Кб9Учебник Философии.docx
#
03.04.20152.83 Mб60Учебное пособие _ 30.01.12 _ правил Журавлев.doc
#
03.04.20152.97 Mб60Учебное пособие _ 30.01.12 _ правил Журавлев.doc
#
03.11.20181.2 Mб126Учебное пособие по психологии и педагогике.docx
#
03.04.2015100.35 Кб114учет труда и зарплаты.doc
#
03.04.2015214.02 Кб11ФГОС НОО.doc
#
06.12.2018152.06 Кб9Федеральное агентство по образованию.doc
#
20.11.2019348.93 Кб12Федеральное агентство по образованию.docx