realtime الأصلي لدى الموفّر،
وstt-tts المحلي أو المتدفق، وtranscription لالتقاط الكلام بغرض المراقبة فقط. تشترك هذه
الأوضاع في أدلة الموفّرين، وأغلفة الأحداث، ودلالات الإلغاء مع
الاتصالات الهاتفية والاجتماعات والتفاعل الآني في المتصفح والعملاء الأصليين الذين يدعمون الضغط للتحدث.
الإمكانات
إنشاء الصور
أنشئ الصور وعدّلها انطلاقًا من مطالبات نصية أو صور مرجعية عبر
image_generate. تعمل بصورة غير متزامنة في جلسات الدردشة — إذ تُنفَّذ في الخلفية
وتنشر النتيجة عند جاهزيتها.إنشاء الفيديو
تحويل النص إلى فيديو، والصورة إلى فيديو، والفيديو إلى فيديو عبر
video_generate.
تعمل بصورة غير متزامنة — إذ تُنفَّذ في الخلفية وتنشر النتيجة عند جاهزيتها.إنشاء الموسيقى
أنشئ موسيقى أو مسارات صوتية عبر
music_generate. تعمل بصورة غير متزامنة في جلسات
الدردشة ضمن دورة حياة مهام إنشاء الوسائط المشتركة.تحويل النص إلى كلام
حوّل الردود الصادرة إلى صوت منطوق عبر أداة
tts بالإضافة إلى
إعداد messages.tts. تعمل بصورة متزامنة.فهم الوسائط
لخّص الصور والصوت والفيديو الواردة باستخدام موفّري نماذج
يدعمون الرؤية وplugins مخصصة لفهم الوسائط.
تحويل الكلام إلى نص
انسخ الرسائل الصوتية الواردة نصيًا عبر موفّري STT بالدُفعات أو
موفّري STT المتدفق لمكالمات Voice Call.
مصفوفة إمكانات الموفّرين
يغطي هذا الجدول plugins المخصصة لإنشاء الوسائط وTTS وSTT. كما تفهم
العديد من موفّري نماذج الدردشة (Anthropic وGoogle وOpenAI وغيرها)
الوسائط الواردة من خلال نموذج الرد الخاص بها؛ راجع القائمة الكاملة للموفّرين في
فهم الوسائط.
يعني الصوت الآني هنا التفاعل الآني ثنائي الاتجاه الأصلي لدى الموفّر (وضع Talk
realtime، مثل Gemini Live أو OpenAI Realtime API) — ولا يسجله حاليًا سوى Google
وOpenAI. تسجل Deepgram وElevenLabs وMistral وOpenAI وxAI
بصورة منفصلة خدمة STT المتدفقة لمكالمات Voice Call (تحويل الصوت إلى نص في اتجاه واحد)؛ راجع
تحويل الكلام إلى نص ومكالمات Voice Call أدناه.
يُعد الصوت الآني لدى xAI إمكانية متاحة في المنبع، لكنه غير مسجل في
OpenClaw حتى يصبح عقد الصوت الآني المشترك قادرًا على تمثيله.غير المتزامن مقابل المتزامن
بالنسبة إلى الأدوات غير المتزامنة، يرسل OpenClaw الطلب إلى الموفّر، ويعيد معرّف
المهمة فورًا، ويتتبع المهمة في سجل المهام. يواصل الوكيل
الرد على الرسائل الأخرى أثناء تنفيذ المهمة. عندما ينتهي الموفّر،
يوقظ OpenClaw الوكيل مع مسارات الوسائط المنشأة حتى يتمكن من إبلاغ
المستخدم عبر وضع الرد المرئي المعتاد للجلسة: تسليم الرد النهائي
تلقائيًا عند تهيئته، أو
message(action="send") عندما تتطلب الجلسة
أداة الرسائل. إذا كانت جلسة مقدّم الطلب غير نشطة أو فشلت عملية إيقاظها
النشطة، وكانت بعض الوسائط المنشأة لا تزال مفقودة من رد الإكمال،
يرسل OpenClaw إجراءً احتياطيًا مباشرًا قابلًا للتكرار بأمان لا يحتوي إلا على الوسائط المفقودة. ولا تُنشر
الوسائط التي سلّمها رد الإكمال بالفعل مرة أخرى.
تحويل الكلام إلى نص ومكالمات Voice Call
يمكن لكل من Deepgram وDeepInfra وElevenLabs وGoogle وGroq وMistral وOpenAI وOpenRouter وSenseAudio وxAI نسخ الصوت الوارد نصيًا عبر مسار الدُفعاتtools.media.audio عند تهيئته. تضع plugins القنوات التي تجري فحصًا مسبقًا
لملاحظة صوتية من أجل تقييد الإشارات أو تحليل الأوامر علامة على المرفق المنسوخ
نصيًا ضمن السياق الوارد، وبذلك تعيد مرحلة فهم الوسائط المشتركة
استخدام ذلك النص بدلًا من إجراء استدعاء STT ثانٍ للصوت نفسه.
كما تسجل Deepgram وElevenLabs وMistral وOpenAI وxAI موفّري
STT المتدفق لمكالمات Voice Call، بحيث يمكن توجيه الصوت الهاتفي المباشر إلى المورّد
المحدد دون انتظار اكتمال التسجيل.
بالنسبة إلى محادثات المستخدم المباشرة، يُفضّل استخدام وضع Talk. تبقى مرفقات الصوت
المعالجة بالدُفعات ضمن مسار الوسائط؛ بينما ينبغي للصوت الآني في المتصفح والضغط الأصلي للتحدث
والاتصالات الهاتفية وصوت الاجتماعات استخدام أحداث Talk والأدلة ذات نطاق الجلسة
التي يعيدها Gateway.
تعيينات الموفّرين (كيفية توزيع المورّدين عبر الأسطح)
Google
أسطح الصور والفيديو والموسيقى وTTS بالدُفعات وSTT بالدُفعات والصوت الآني
في الواجهة الخلفية وفهم الوسائط.
OpenAI
OpenAI
أسطح الصور والفيديو وTTS بالدُفعات وSTT بالدُفعات وSTT المتدفق لمكالمات Voice Call
والصوت الآني في الواجهة الخلفية وتضمين الذاكرة.
DeepInfra
DeepInfra
أسطح توجيه الدردشة/النماذج وإنشاء الصور/تحريرها وتحويل النص إلى فيديو وTTS
بالدُفعات وSTT بالدُفعات وفهم وسائط الصور وتضمين الذاكرة.
تعرض DeepInfra أيضًا إعادة الترتيب والتصنيف واكتشاف الكائنات
وأنواعًا أصلية أخرى من النماذج؛ لا يملك OpenClaw عقد موفّر لهذه
الفئات حتى الآن، ولذلك لا تسجل هذه Plugin هذه الإمكانات.
xAI
xAI
الصور والفيديو والبحث وتنفيذ التعليمات البرمجية وTTS بالدُفعات وSTT بالدُفعات وSTT
المتدفق لمكالمات Voice Call. يُعد الصوت الآني لدى xAI إمكانية متاحة في المنبع، لكنه
غير مسجل في OpenClaw حتى يصبح عقد الصوت الآني المشترك قادرًا
على تمثيله.