ما الذي يفعله
عند تمكين فهم الصوت (أو اكتشافه تلقائيًا)، يقوم OpenClaw بما يلي:- يحدد موقع أول مرفق صوتي (مسار محلي أو عنوان URL) وينزّله عند الحاجة.
- يفرض حد
maxBytesقبل الإرسال إلى كل إدخال نموذج. - يشغّل أول إدخال نموذج مؤهل بالترتيب (موفّر أو CLI)؛ وإذا فشل إدخال أو تم تخطيه (بسبب الحجم/المهلة)، تُجرَّب الخانة التالية.
- عند النجاح، يستبدل
Bodyبكتلة[Audio]ويضبط{{Transcript}}.
CommandBody/RawBody أيضًا على النص المنسوخ لتظل أوامر الشرطة المائلة عاملة. مع --verbose، تُظهر السجلات وقت تشغيل النسخ ووقت استبداله للمحتوى.
الاكتشاف التلقائي (الافتراضي)
إذا لم تكن قد هيأت نماذج ولم تكن قيمةtools.media.audio.enabled هي false، يجري OpenClaw الاكتشاف التلقائي بالترتيب التالي ويتوقف عند أول خيار عامل:
- نموذج الرد النشط، عندما يدعم موفّره فهم الصوت.
- مصادقة الموفّر المهيأة — أي إدخال
models.providers.*تتوفر له مصادقة لموفّر يدعم نسخ الصوت. يُتحقق من ذلك قبل أدوات CLI المحلية، لذا يتغلب مفتاح API المهيأ دائمًا على ملف تنفيذي محلي موجود فيPATH. أولوية الموفّرين عند تهيئة عدة موفّرين: Groq، OpenAI، xAI، Deepgram، Google، SenseAudio، ElevenLabs، Mistral. - أدوات CLI المحلية (فقط إذا لم تُحلّ مصادقة أي موفّر). ينشئ OpenClaw قائمة بدائل مرتبة:
whisper-cli، قبل الإعدادات الافتراضية لوحدة المعالجة المركزية فقط عندما تكون عملية استدعاء نموذج سابقة في العملية الحالية قد رصدت Metal أو CUDAsherpa-onnx-offlineعلى موفّر وحدة المعالجة المركزية الافتراضي الخاص به (يتطلبSHERPA_ONNX_MODEL_DIRويحتوي علىtokens.txtوencoder.onnxوdecoder.onnxوjoiner.onnx)whisper-cliعندما لا يكون Metal/CUDA إلا مدعومًا عند البناء أو عندما تكون الواجهة الخلفية المحددة غير مرصودة بطريقة أخرىparakeet-mlxعلى Apple Silicon (قادر على استخدام MLX؛ يظل استخدام الجهاز غير مرصود)whisper(CLI بلغة Python؛ ينزّل النماذج تلقائيًا)
using … backend. وتحتفظ إدخالات CLI الصريحة بعلامات الإخراج المهيأة لها.
استُبدل الاكتشاف التلقائي لـ Gemini CLI لفهم الوسائط بخيار احتياطي معزول لـ Antigravity CLI (agy) للصور/الفيديو؛ ولا يستخدم الصوت خيار CLI احتياطيًا غير الملفات التنفيذية المحلية المذكورة أعلاه.
لتعطيل الاكتشاف التلقائي، اضبط tools.media.audio.enabled: false. وللتخصيص، اضبط tools.media.audio.models.
يُجرى اكتشاف الملفات التنفيذية بأفضل جهد ممكن عبر macOS/Linux/Windows. تأكد من وجود CLI في
PATH (يجري توسيع ~)، أو اضبط نموذج CLI صريحًا بمسار أمر كامل./status الواجهة الخلفية المطلوبة أو المرصودة في سطر الوسائط. وتظل إدخالات CLI الصريحة في tools.media.audio.models تتجاوز الاختيار التلقائي؛ استخدم علاماتها الخاصة بالواجهة الخلفية مثل --provider=cuda في sherpa أو --no-gpu/--device في whisper.cpp.
أمثلة التهيئة
موفّر + خيار CLI احتياطي (OpenAI + Whisper CLI)
موفّر فقط مع تقييد النطاق
موفّر فقط (Deepgram)
موفّر فقط (Mistral Voxtral)
موفّر فقط (SenseAudio)
إعادة إرسال النص المنسوخ إلى الدردشة (اشتراك اختياري)
ملاحظات وحدود
- تتبع مصادقة الموفّر ترتيب مصادقة النموذج القياسي (ملفات تعريف المصادقة، ومتغيرات البيئة، و
models.providers.*.apiKey). - تفاصيل إعداد Groq: Groq.
- يلتقط Deepgram قيمة
DEEPGRAM_API_KEYعند استخدامprovider: "deepgram". تفاصيل الإعداد: Deepgram. - تفاصيل إعداد Mistral: Mistral.
- يلتقط SenseAudio قيمة
SENSEAUDIO_API_KEYعند استخدامprovider: "senseaudio". تفاصيل الإعداد: SenseAudio. - يمكن لموفّري الصوت تجاوز
baseUrlوheadersوproviderOptionsعبرtools.media.audio. - حد الحجم الافتراضي هو 20 ميغابايت (
tools.media.audio.maxBytes). يُتخطى الصوت المتجاوز للحجم لذلك النموذج وتُجرَّب الخانة التالية. - تُتخطى الملفات الصوتية التي يقل حجمها عن 1024 بايت قبل النسخ عبر الموفّر/CLI.
- قيمة
maxCharsالافتراضية للصوت غير مضبوطة (النص المنسوخ كاملًا). اضبطtools.media.audio.maxCharsأو قيمةmaxCharsلكل إدخال لاقتطاع الإخراج. - الإعداد الافتراضي للاكتشاف التلقائي في OpenAI هو
gpt-4o-transcribe؛ اضبطmodel: "gpt-4o-mini-transcribe"للحصول على خيار أرخص/أسرع. - استخدم
tools.media.audio.attachmentsلمعالجة عدة ملاحظات صوتية (mode: "all"معmaxAttachments، والقيمة الافتراضية 1). - يتوفر النص المنسوخ للقوالب باسم
{{Transcript}}. - تكون
tools.media.audio.echoTranscriptمعطلة افتراضيًا؛ فعّلها لإرسال تأكيد بالنص المنسوخ إلى الدردشة الأصلية قبل معالجة الوكيل. - تخصص
tools.media.audio.echoFormatنص إعادة الإرسال (العنصر النائب:{transcript}؛ الافتراضي📝 "{transcript}"). - يقتصر stdout الخاص بـ CLI على 5 ميغابايت؛ أبقِ إخراج CLI موجزًا.
- ينبغي أن تستخدم
argsالخاصة بـ CLI القيمة{{MediaPath}}لمسار ملف الصوت المحلي. شغّلopenclaw doctor --fixلترحيل العناصر النائبة المهملة{input}من تهيئاتaudio.transcription.commandالقديمة (المفتاح المتقاعد:audio.transcription، وقد استُبدل بـtools.media.audio.models). - تحد
tools.media.concurrencyمن مهام الوسائط؛ وليست مجدولًا لوحدة معالجة الرسومات.
تحويل الكلام إلى نص محلي مقيم
يظل تحويل الكلام إلى نص المحلي المكتشف تلقائيًا عمليةً مستقلة لكل طلب. لا يدير OpenClaw حاليًا خادم whisper.cpp مقيمًا لأن حزمة Homebrew القياسيةwhisper-cpp تعطّل ذلك الخادم، بينما لا يتضمن مثال المنبع قائمة انتظار قبول محدودة مهيأة. تحتاج دورة حياة مقيمة يملكها Plugin إلى عامل محزّم خاضع للصيانة يتضمن التحقق من الصحة/بدء التشغيل، وإبقاء النموذج مقيمًا، وقائمة انتظار محدودة، والإلغاء/المهلة، وتشغيلًا دون مصادقة ومقتصرًا على local loopback، ومن دون خيار سحابي احتياطي، قبل أن يمكن تمكينها بأمان.
دعم بيئة الوكيل
يحترم نسخ الصوت القائم على الموفّر متغيرات بيئة الوكيل الصادر القياسية، بما يطابق دلالاتEnvHttpProxyAgent في undici:
HTTPS_PROXY/https_proxyHTTP_PROXY/http_proxyALL_PROXY/all_proxy
NO_PROXY/no_proxy (أسماء المضيفين، أو *.suffix، أو host:port) الوكيل. إذا لم تُضبط متغيرات بيئة للوكيل، يُستخدم الخروج المباشر. وإذا فشل إعداد الوكيل (عنوان URL مشوّه)، يسجّل OpenClaw تحذيرًا ويعود إلى الجلب المباشر.
اكتشاف الإشارات في المجموعات
في القنوات التي تدعم الفحص المسبق للصوت، ينسخ OpenClaw الصوت قبل التحقق من الإشارات عند ضبطrequireMention: true لدردشة جماعية. يتيح ذلك لملاحظة صوتية بلا تعليق اجتياز بوابة الإشارة عندما يحتوي نصها المنسوخ على نمط إشارة مهيأ. تصف الوثائق الخاصة بكل قناة وسائل النقل التي تتطلب إشارة مكتوبة بدلًا من ذلك.
آلية العمل:
- إذا لم تكن للرسالة الصوتية هيئة نصية وكانت المجموعة تتطلب إشارات، يجري OpenClaw نسخًا مسبقًا لأول مرفق صوتي.
- يُفحص النص المنسوخ بحثًا عن أنماط الإشارات (مثل
@BotName، ومحفزات الرموز التعبيرية). - إذا عُثر على إشارة، تتابع الرسالة مسار معالجة الرد الكامل.
- اضبط
channels.telegram.groups.<chatId>.disableAudioPreflight: trueلتخطي فحوصات إشارات النص المنسوخ المسبقة لتلك المجموعة. - اضبط
channels.telegram.groups.<chatId>.topics.<threadId>.disableAudioPreflightللتجاوز حسب الموضوع (trueللتخطي، وfalseلفرض التمكين). - القيمة الافتراضية هي
false(يُفعّل الفحص المسبق عندما تتطابق شروط بوابة الإشارة).
requireMention: true. تُنسخ الملاحظة الصوتية، وتُكتشف الإشارة، ويرد الوكيل.
محاذير
- تستخدم قواعد النطاق مبدأ أول تطابق يفوز؛ وتُطبَّع
chatTypeإلىdirectأوgroupأوchannel. - تأكد من أن CLI يخرج بالرمز 0 ويطبع نصًا عاديًا؛ ويجب معالجة إخراج JSON باستخدام
jq -r .text. - تُعد أوضاع إخراج الملفات المعروفة مرجعية: لا ينتج ملف نص منسوخ مستنتج فارغ أو مفقود أي نص منسوخ بدلًا من الرجوع إلى إخراج تقدم CLI.
- بالنسبة إلى
parakeet-mlx، استخدم--output-format txt(أوall) مع--output-dirوقالب الإخراج الافتراضي{filename}. تُحترم أيضًا متغيرات البيئةPARAKEET_OUTPUT_FORMATوPARAKEET_OUTPUT_TEMPLATEفي المنبع. يقرأ OpenClaw الملف<output-dir>/<media-basename>.txt؛ ويستمر تنسيقsrtالافتراضي والتنسيقات الأخرى وقوالب الإخراج المخصصة في استخدام stdout. - أبقِ المهل معقولة (
timeoutSeconds، والقيمة الافتراضية 60 ثانية) لتجنب حظر قائمة انتظار الردود. - لا يعالج النسخ المسبق سوى أول مرفق صوتي لاكتشاف الإشارات. وتُعالج المرفقات الصوتية الإضافية خلال مرحلة فهم الوسائط الرئيسية.