ЦАРЬ РОУТЕР

Распознавание речи

POST/v1/audio/transcriptions

Текст из аудиофайла в формате OpenAI Audio. Распознавание в реальном времени - в руководстве «Потоковое распознавание речи».

Параметры, которых нет в OpenAI SDK (diarize, roles, only и другие), передайте через extra_body в Python или как дополнительные поля объекта в TypeScript.

С response_format text, srt или vtt ответ - обычный текст (Content-Type: text/plain) без usage; цена - только в заголовке X-Cost-Rub. Если модель не распознала ни слова, запрос не оплачивается и уходит другому провайдеру модели, если он есть.

Стоимость. Оплата - по длительности записи. Платные опции diarize, roles и profanity_filter есть у моделей с полем addons в карточке, там же их цена за секунду. Цена опции прибавляется к цене модели. Другие модели diarize и roles не учитывают.

Лимиты. Действуют общий лимит аккаунта и лимит типа моделей stt - см. «Лимиты».

Авторизация

ModelsKey
АвторизацияBearer <ключ>

Ключ типа «Вызов моделей»: Authorization: Bearer sk-tsar-ваш-ключ. Ключ «Просмотр баланса» получит 403 insufficient_scope.

Где: header

Тело запроса

multipart/form-data

Тело ответа

application/json

application/json

application/json

application/json

text/html

application/json

application/json

curl https://api.tsarrouter.ru/v1/audio/transcriptions \  -H "Authorization: Bearer $TSARROUTER_KEY" \  -F model=palatine/speech-to-text \  -F file=@speech.mp3

{  "text": "Привет, это царь роутер.",  "usage": {    "type": "duration",    "seconds": 2.47,    "cost_rub": 0.011938  }}