Облачные API речи
Google Cloud Speech для работы с аудио
Cloud Text-to-Speech создает аудио из текста и SSML, а Speech-to-Text распознает короткие, длинные и потоковые записи.
Как подготовлен материалПо официальной документации и страницам тарифов. Самостоятельный тест голоса не проводился. Данные проверены 27 июля 2026 года.
Лучше подходитПриложения и большие процессы, уже работающие в Google Cloud
Бесплатный доступНовые аккаунты могут использовать стартовые Cloud credits и доступные бесплатные квоты.
Платный доступДальнейшее использование оплачивается по тарифам API и выбранному типу голоса или распознавания.
Как устроена работа
Исходные данныеТекст, SSML, аудиофайл или поток и настройки Google Cloud.
Рабочая средаREST API, клиентские библиотеки, gcloud и облачные проекты.
ФункцииСинтез речи, batch и streaming transcription, настройка темпа, высоты и произношения.
РезультатMP3, LINEAR16 и другие поддерживаемые аудиоформаты или текстовая расшифровка.
Подходит, если
Сильные стороны
- Есть синтез и распознавание речи
- Поддерживаются SSML и программные настройки
- Удобно масштабировать внутри Google Cloud
Важно учесть
Ограничения
- Это API, а не готовая монтажная студия
- Нужно настроить проект, биллинг и права доступа
- Поддержка языка и функций различается по моделям
