Облачные API речи

Google Cloud Speech для работы с аудио

Cloud Text-to-Speech создает аудио из текста и SSML, а Speech-to-Text распознает короткие, длинные и потоковые записи.

Как подготовлен материалПо официальной документации и страницам тарифов. Самостоятельный тест голоса не проводился. Данные проверены 27 июля 2026 года.
Лучше подходитПриложения и большие процессы, уже работающие в Google Cloud
Бесплатный доступНовые аккаунты могут использовать стартовые Cloud credits и доступные бесплатные квоты.
Платный доступДальнейшее использование оплачивается по тарифам API и выбранному типу голоса или распознавания.
Проверяемые характеристики

Как устроена работа

Исходные данныеТекст, SSML, аудиофайл или поток и настройки Google Cloud.
Рабочая средаREST API, клиентские библиотеки, gcloud и облачные проекты.
ФункцииСинтез речи, batch и streaming transcription, настройка темпа, высоты и произношения.
РезультатMP3, LINEAR16 и другие поддерживаемые аудиоформаты или текстовая расшифровка.
Подходит, если

Сильные стороны

  • Есть синтез и распознавание речи
  • Поддерживаются SSML и программные настройки
  • Удобно масштабировать внутри Google Cloud
Важно учесть

Ограничения

  • Это API, а не готовая монтажная студия
  • Нужно настроить проект, биллинг и права доступа
  • Поддержка языка и функций различается по моделям
Первоисточники

Официальные страницы