SaluteSpeech для работы с аудио
API и настольное приложение для синтеза и распознавания речи с голосами, SSML-разметкой и управлением интонацией, скоростью и паузами.
Как устроена работа
Сильные стороны
- Есть отдельное приложение для ручной работы
- SSML позволяет управлять русскими числами, датами и интонацией
- Подходит и пользователям, и разработчикам API
Ограничения
- Freemium нельзя считать разрешением на коммерческое использование
- Лимиты различаются для физических лиц и организаций
- Перед публикацией нужно проверить произношение имен, брендов и чисел
Сценарий: приемка TTS для телефонного меню
SaluteSpeech TTS в голосовом меню оценивают не по естественности отдельной фразы, а по разборчивости через телефонный канал и логике диалога. Текст сначала сокращают, числа и сокращения нормализуют, а варианты ответа называют одинаково. В синтез не передают персональные данные клиента. Динамические значения проходят отдельную проверку формата.
Стоп-сигналы голосового меню
- Реплики короткие.
- Клавиша звучит в конце.
- Числа однозначны.
- Повтор ограничен.
- Оператор доступен.
Меню статуса доставки без ввода номера голосом
Система приветствует пользователя, предлагает нажать одну из трех клавиш и объясняет возврат в начало. Статус заказа в этой версии не зачитывается, поэтому личные данные отсутствуют. Реплики короче десяти секунд, действие называется в конце фразы. При неизвестном вводе меню повторяется один раз и переводит на оператора.
Хорошая студийная запись может плохо звучать по телефону
Кодек и шум меняют согласные, числа и паузы. Приемка проводится в том канале, где пользователь действительно услышит сообщение.
Ревью реплик в телефонном канале
Соберите карту диалога
Покажите вход, три ветки, повтор, таймаут и перевод на оператора.
Нормализуйте текст
Раскройте сокращения, запишите числа словами и исключите двусмысленные ударения.
Синтезируйте по узлам
Сохраняйте отдельный файл для каждой ветки с ID из карты.
Проверьте канал
Прослушайте после телефонного кодека, на громкой связи и при умеренном шуме.
Пройдите ошибки
Проверьте таймаут, неверную клавишу, повтор и доступный переход к оператору.
Частые вопросы по сценарию
Зачем ограничивать повтор?
Бесконечный цикл мешает получить помощь и делает ошибку интерфейса непреодолимой.
Можно ли зачитывать персональные данные?
Только в отдельно спроектированном защищенном сценарии с проверкой правил и идентификации.
Карта IVR и библиотека узлов
Передайте карту диалога, тексты, выбранный голос, параметры синтеза, файлы с ID и результаты проверки через целевой кодек. Укажите владельца каждой реплики и дату утверждения. Любое динамическое сообщение проходит отдельную проверку безопасности и произношения до включения.
Что зафиксировать для воспроизводимой озвучки
До пакетной работы заморозьте текст, идентификаторы реплик, словарь произношения, роль голоса, паузы и технический формат. Для записи или клонирования реального человека нужны законное основание, необходимые права и согласие. Не проектируйте голос как имитацию известного человека. Исходники, принятые файлы и версии после монтажа храните раздельно.
При приемке сверяйте звук с субтитром, слушайте начало и окончание, числа, имена, ударения и переходы между соседними репликами. Проверьте уровень, пики, шум, формат и частоту дискретизации в требованиях конечного проекта. Финальный пример стоит слушать в миксе, в наушниках и на обычном динамике телефона. Журнал должен связывать файл с текстом, настройками, датой и ответственным редактором. При повторном экспорте сравните длительность с принятой версией и убедитесь, что монтажная система не добавила тишину, обрезку окончания или новое преобразование уровня.
Официальные страницы
Как подойти к работе с SaluteSpeech
API и настольное приложение для синтеза и распознавания речи с голосами, SSML-разметкой и управлением интонацией, скоростью и паузами. Карточка помогает заранее понять подходящий сценарий, подготовить исходные материалы и проверить результат до оплаты подписки или использования его в рабочем проекте.
Сформулируйте конкретный результат
Текст, SSML-разметка, выбранный голос и параметры синтеза. Чем точнее исходные условия, тем проще сравнить результат с первоначальной задачей.
Проверьте рабочий процесс
SaluteSpeech App для Windows и macOS, Studio и API. Ожидаемый результат: Синтезированная аудиодорожка или API-ответ в поддерживаемом формате.
Оцените результат вручную
Сильная сторона сервиса: Есть отдельное приложение для ручной работы. При этом важно учитывать: Freemium нельзя считать разрешением на коммерческое использование.
Когда имеет смысл выбирать этот сервис
SaluteSpeech в первую очередь подходит для сценария: Русская озвучка через приложение или интеграция речи в продукт через API.
Бесплатный доступ: Для физических лиц доступен ограниченный Freemium. Созданный в нем контент предназначен для личного некоммерческого использования. Платный доступ: Коммерческое использование требует платного пакета; для компаний доступны пакетная и договорная тарификация.
