Speech-to-Text (Transcriptions & Translations)

تبدیل فایل صوتی به متن به همان زبان یا ترجمه به انگلیسی.

اندپوینت‌ها

POSThttps://api.darvareh.ir/v1/audio/transcriptions
POSThttps://api.darvareh.ir/v1/audio/translations
تفاوت: transcriptions خروجی را به همان زبان صوت برمی‌گرداند؛ translations همیشه به انگلیسی ترجمه می‌کند.

پارامترها (multipart/form-data)

پارامترنوعاجباریتوضیح
filefileبلهفایل صوتی: mp3, mp4, mpeg, mpga, m4a, wav, webm. حداکثر ۲۵ مگابایت.
modelstringبلهمثل whisper-1.
languagestringکد ISO زبان مبدأ، مثلاً fa. باعث افزایش دقت می‌شود (فقط در transcriptions).
promptstringمتن راهنما برای اصطلاحات یا اسامی خاص.
response_formatstringjson, text, srt, verbose_json, vtt. پیش‌فرض json.
temperaturenumberمیزان تنوع (۰ تا ۱). پیش‌فرض ۰.

نمونۀ درخواست

curl -X POST https://api.darvareh.ir/v1/audio/transcriptions \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -F file=@meeting.mp3 \
  -F model=whisper-1 \
  -F language=fa \
  -F response_format=verbose_json

نمونۀ پاسخ

{
  "language": "fa",
  "duration": 42.6,
  "text": "سلام و خوش آمدید به جلسۀ درواره…",
  "segments": [
    { "id": 0, "start": 0.0, "end": 3.4, "text": "سلام و خوش آمدید" }
  ]
}

ترجمه به انگلیسی

curl -X POST https://api.darvareh.ir/v1/audio/translations \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -F file=@interview_fa.mp3 \
  -F model=whisper-1

نمونۀ Python

from openai import OpenAI

client = OpenAI(api_key="…", base_url="https://api.darvareh.ir/v1")

with open("meeting.mp3", "rb") as f:
    r = client.audio.transcriptions.create(
        model="whisper-1",
        file=f,
        language="fa",
        response_format="text",
    )
print(r)