Распознавание речи
/v1/audio/transcriptionsТекст из аудиофайла в формате OpenAI Audio. Распознавание в реальном времени - в руководстве «Потоковое распознавание речи».
Параметры, которых нет в OpenAI SDK (diarize, roles, only и другие),
передайте через extra_body в Python или как дополнительные поля объекта в
TypeScript.
С response_format text, srt или vtt ответ - обычный текст
(Content-Type: text/plain) без usage; цена - только в заголовке X-Cost-Rub.
Если модель не распознала ни слова, запрос не оплачивается и уходит другому
провайдеру модели, если он есть.
Стоимость. Оплата - по длительности записи. Платные опции diarize, roles и
profanity_filter есть у моделей с полем addons в карточке, там же их цена за
секунду. Цена опции прибавляется к цене модели. Другие модели diarize и roles
не учитывают.
Лимиты. Действуют общий лимит аккаунта и лимит типа моделей stt - см.
«Лимиты».
Авторизация
ModelsKey Ключ типа «Вызов моделей»: Authorization: Bearer sk-tsar-ваш-ключ.
Ключ «Просмотр баланса» получит 403 insufficient_scope.
Где: header
Тело запроса
multipart/form-data
Тело ответа
application/json
application/json
application/json
application/json
text/html
application/json
application/json
curl https://api.tsarrouter.ru/v1/audio/transcriptions \ -H "Authorization: Bearer $TSARROUTER_KEY" \ -F model=palatine/speech-to-text \ -F file=@speech.mp3{ "text": "Привет, это царь роутер.", "usage": { "type": "duration", "seconds": 2.47, "cost_rub": 0.011938 }}Синтез речи POST
Озвучивает текст в формате OpenAI Audio. Тело ответа - аудиофайл, всё о запросе - в заголовках. Голоса и форматы каждой модели - в полях voices и audio_formats её карточки.
Тональность речи POST
Оценка тональности речи по аудиозаписи: пять классов от «очень негативно» до «очень позитивно». Эндпоинта нет в OpenAI API, поэтому примеры - на обычных HTTP-запросах.