> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-ce69695c.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# نماذج تحويل الكلام إلى نص

> نماذج تحويل الكلام إلى نص في Venice مثل Whisper Large V3 وElevenLabs Scribe مع دعم متعدد اللغات وطوابع زمنية وتسعير محسوب لكل ثانية.

<div id="model-search-placeholder" data-filter="asr">
  استخدم قيمة `id` كمعامل `model` في طلبات API. عدد النماذج المتوفرة حاليًا: 5.

  | النموذج | المعرّف | لكل ثانية صوت | الخصوصية |
  | - | - | - | - |
  | ElevenLabs Scribe V2 | `elevenlabs/scribe-v2` | \$0.0002 | Anonymized |
  | Parakeet ASR | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001 | Private |
  | Whisper Large V3 | `openai/whisper-large-v3` | \$0.0001 | Private |
  | Wizper (Whisper v3) | `fal-ai/wizper` | \$0.0001 | Private |
  | xAI Speech to Text v1 | `stt-xai-v1` | \$0.0000 | Anonymized |
</div>

***

## الاستخدام

تقوم نماذج تحويل الكلام إلى نص بنسخ الصوت المنطوق إلى نص مكتوب. يتم الوصول إليها عبر [واجهة Audio Transcriptions API](/ar/api-reference/endpoint/audio/transcriptions).

### صيغ الصوت المدعومة

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

يُقبل الملف عندما يكون نوع MIME الخاص به أو امتداده ضمن هذه القائمة، ويجب أيضًا أن يجتاز فحص البايتات السحرية (magic-byte) على البايتات المرفوعة. إعادة تسمية ملف بامتداد مدعوم لا تكفي.

### صيغ الاستجابة

| الصيغة | الوصف |
| - | - |
| `json` | الافتراضي. يُرجع `{ "text": "..." }`، بالإضافة إلى `duration` و`timestamps` عند توفرهما. |
| `text` | نص منسوخ عادي. |

### الطوابع الزمنية

عيّن `timestamps: true` لتلقي بيانات التوقيت مع التفريغ. تضيف الاستجابة كائن `timestamps` تعتمد درجة تفصيله على النموذج:

| النموذج | درجة التفصيل |
| - | - |
| `elevenlabs/scribe-v2` | `word` |
| `stt-xai-v1` | `word` |
| `openai/whisper-large-v3` | `segment` |
| `fal-ai/wizper` | `segment` |
| `nvidia/parakeet-tdt-0.6b-v3` | لا شيء |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` هو النموذج الافتراضي، وهو يقبل `timestamps: true` دون إرجاع توقيتات. لا يوجد خطأ ولا تحذير — تحتوي الاستجابة ببساطة على `text` ولا شيء آخر. إذا كنت بحاجة إلى التوقيتات، اختر نموذجًا من الجدول أعلاه وتحقق من وجود المفتاح `timestamps` قبل قراءته.
</Warning>

إدخالات الكلمات على شكل `{ "word": "...", "start": 0.0, "end": 0.5 }` وإدخالات المقاطع على شكل `{ "text": "...", "start": 0.0, "end": 3.2 }`، وجميع الأزمنة بالثواني.

<Note>
  يتم احتساب التسعير لكل ثانية من الصوت المُدخَل. راجع [واجهة Audio Transcriptions API](/ar/api-reference/endpoint/audio/transcriptions) للحصول على أمثلة الطلبات وتفاصيل المعاملات.
</Note>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.