github

video-use: مونتاج الفيديو بالذكاء الاصطناعي من GitHub

video-use: مونتاج الفيديو بالذكاء الاصطناعي من GitHub
video-use: مونتاج الفيديو بالذكاء الاصطناعي من GitHub

video-use مشروع مفتوح المصدر على GitHub يحاول نقل تحرير الفيديو من واجهات المونتاج التقليدية إلى أسلوب مختلف تمامًا: ضع ملفات التصوير الخام في مجلد، افتح وكيل برمجي مثل Claude Code أو Codex، ثم اشرح له باللغة العادية كيف تريد الفيديو النهائي. المشروع يتولى تحليل المادة، اقتراح استراتيجية للمونتاج، تنفيذ القص والتلوين والترجمة، ثم يراجع النتيجة بنفسه قبل أن يعرض عليك ملف final.mp4.

الإجابة السريعة

فكرة video-use ليست إنشاء فيديو من الصفر، بل تحرير فيديوهات موجودة باستخدام وكيل برمجي. الأداة تستطيع إزالة الترددات والكلمات الحشو والتوقفات غير الضرورية، تنفيذ تصحيح ألوان، إضافة انتقالات صوتية قصيرة عند القص، حرق الترجمة داخل الفيديو، وإنشاء عناصر متحركة عبر أدوات مثل Remotion وManim. المشروع مفتوح المصدر بترخيص MIT، ويعتمد في التثبيت المحلي على Python وFFmpeg، ويستخدم ElevenLabs Scribe للحصول على تفريغ صوتي دقيق بتوقيتات الكلمات.

مونتاج الفيديو من خلال المحادثة بدل Timeline تقليدي

الاختلاف الأساسي في video-use هو أن المستخدم لا يبدأ من Timeline مليء بالمسارات والمقاطع. بدل ذلك، يتعامل مع وكيل برمجي عبر المحادثة. تضع الفيديوهات الخام في مجلد، تدخل إلى المجلد من الطرفية، تشغل الأداة أو الوكيل الذي تستخدمه، ثم تكتب طلبًا مثل: «حوّل هذه اللقطات إلى فيديو إطلاق قصير».

بعد ذلك لا تبدأ الأداة في القص فورًا. وفق قواعد المشروع، تقوم أولًا بجرد الملفات الموجودة وفهم المادة واقتراح استراتيجية تحرير، ثم تنتظر موافقة المستخدم قبل تنفيذ التعديلات. هذه النقطة مهمة لأن المشروع مصمم على مبدأ «اسأل، وافق، نفذ، راجع، واحفظ»، لا على اتخاذ قرارات مونتاج نهائية دون تدخل صاحب الفيديو.

كيف يفهم الفيديو إذا كان النموذج لا يشاهد كل الإطارات؟

من أكثر الأفكار إثارة في video-use أن النموذج اللغوي لا يقوم بمشاهدة كل Frame من الفيديو واحدًا تلو الآخر. المشروع يعتبر ذلك مكلفًا ومزعجًا من ناحية حجم البيانات، ولذلك يعتمد على طبقتين مختلفتين لفهم المادة.

الطبقة الأولى هي الصوت. كل ملف فيديو يمر بعملية تفريغ باستخدام ElevenLabs Scribe للحصول على الكلمات مع توقيت كل كلمة، وتحديد المتحدث، وبعض الأحداث الصوتية مثل الضحك أو التصفيق. بعد ذلك يجمع المشروع هذه المعلومات في ملف نصي مضغوط نسبيًا يصبح المرجع الرئيسي الذي يقرأه الوكيل لاتخاذ قرارات القص.

الطبقة الثانية بصرية وتعمل عند الحاجة فقط. عندما توجد وقفة غير واضحة، أو محاولة تصوير مكررة، أو نقطة قص تحتاج إلى مراجعة، ينشئ المشروع صورة مركبة تحتوي على Filmstrip وموجة صوتية وتسميات الكلمات خلال الفترة المطلوبة. بهذه الطريقة يرى الوكيل السياق البصري في نقاط القرار المهمة بدل إرسال عشرات الآلاف من الإطارات بلا داعٍ.

خط سير العمل داخل video-use

المرحلة ما الذي يحدث؟
Transcribe تحويل الصوت إلى نص مع توقيت الكلمات وتحديد المتحدثين.
Pack ضغط التفريغ من جميع اللقطات في ملف نصي منظم.
LLM Reasons الوكيل يقرأ المادة ويقرر أين يقص وكيف يرتب المحتوى.
EDL تحويل القرارات إلى قائمة تحرير قابلة للتنفيذ.
Render تنفيذ القص والتعديلات وإنتاج الفيديو النهائي.
Self-Eval مراجعة نقاط القص واكتشاف القفزات والمشكلات ثم إعادة التصيير عند الحاجة.

هذه البنية تجعل video-use أقرب إلى «محرر فيديو آلي له طريقة تفكير» من كونه برنامج مونتاج تقليديًا. فهو لا يطبق قالبًا ثابتًا على كل الفيديوهات، بل يحاول فهم المادة أولًا ثم اتخاذ قرارات تحرير تناسبها.

إزالة الترددات واللقطات الفاشلة تلقائيًا

واحدة من المهام التي يبرزها المشروع هي تنظيف الكلام. يستطيع video-use اكتشاف كلمات الحشو مثل “umm” و“uh”، والتوقفات الطويلة، والبدايات الخاطئة، والمساحات الصامتة بين المحاولات. وبما أن التفريغ يحمل توقيتات على مستوى الكلمة، يمكن تنفيذ القص عند حدود الكلام بدقة أفضل من الاعتماد على اكتشاف الصمت وحده.

هذه الوظيفة مناسبة تحديدًا لفيديوهات Talking Head والشروحات والمقابلات، حيث يكون الجزء الأكبر من وقت المونتاج في كثير من الأحيان هو البحث عن المحاولة الأفضل وإزالة الترددات والتكرار.

ليس مجرد قص: ألوان وترجمة ورسوم متحركة

بعد بناء الـRough Cut، يستطيع video-use تنفيذ مجموعة أخرى من المهام. المشروع يدعم معالجة الألوان لكل Segment باستخدام FFmpeg، سواء بأجواء دافئة سينمائية أو معالجة محايدة أو سلسلة Filters يحددها المستخدم بنفسه.

ويضيف المشروع Fade صوتيًا قصيرًا عند كل نقطة قص لتقليل احتمالات سماع Pop أو انقطاع حاد في الصوت. كما يستطيع حرق Subtitles داخل الفيديو، والنمط الافتراضي المذكور في المستودع يستخدم أجزاء قصيرة من كلمتين بحروف كبيرة، لكن المشروع يؤكد أن الأسلوب قابل للتخصيص ولا يمثل قاعدة إجبارية.

أما العناصر المتحركة فيمكن إنشاؤها باستخدام HyperFrames أو Remotion أو Manim أو PIL، ويمكن للوكيل تشغيل مهام متوازية بحيث يتولى Agent فرعي كل Animation على حدة قبل دمج النتائج في الفيديو.

المراجعة الذاتية قبل تسليم final.mp4

ميزة لافتة أخرى هي مرحلة Self-Eval. بعد Render، يشغل video-use أداة العرض الزمني حول كل نقطة قص في الفيديو الناتج، ويبحث عن مشكلات مثل القفزة البصرية المفاجئة، أو Pop في الصوت، أو Subtitle مختفٍ أو مقطوع.

إذا وجد مشكلة، يستطيع إعادة إصلاح الجزء وإعادة التصيير، مع حد لعدد محاولات الإصلاح. ووفق README الرسمي، لا يعرض المشروع المعاينة للمستخدم إلا بعد مرورها على هذه المرحلة. الفكرة هنا ليست ضمان فيديو مثالي فنيًا، بل التقاط الأخطاء التقنية الواضحة قبل التسليم.

يحفظ ذاكرة المشروع بين جلسة وأخرى

لا يفترض video-use أن كل جلسة تحرير منفصلة. المشروع يحتفظ بملف project.md لتسجيل القرارات والسياق، بحيث يمكن لجلسة الأسبوع التالي معرفة ما تم الاتفاق عليه سابقًا. هذه نقطة مفيدة للمشروعات المتكررة مثل حلقات البودكاست أو فيديوهات قناة لها نمط ثابت.

بدل شرح الخطوط العامة والأذواق نفسها من جديد، يمكن أن تصبح الذاكرة جزءًا من سير العمل. ومع ذلك، تظل تعليمات المشروع واضحة في أن القيم والأساليب والألوان والأحجام الموجودة في أمثلته ليست Presets إلزامية، بل أمثلة يمكن تغييرها حسب نوع المحتوى.

ما الذي تحتاجه لتشغيله محليًا؟

المشروع ليس تطبيق Desktop جاهزًا بزر تثبيت واحد. هو Skill موجه لوكلاء برمجيين يملكون وصولًا إلى الطرفية. التعليمات الرسمية تذكر Claude Code وCodex وHermes وOpenClaw، مع إمكانية استخدام أي Agent يستطيع تنفيذ أوامر Shell.

المكوّن دوره
Python تشغيل أدوات المشروع والمكتبات المساعدة.
FFmpeg القص والتصيير ومعالجة الصوت والفيديو.
وكيل برمجي قراءة المادة واتخاذ قرارات التحرير وتنفيذ الخطوات.
ElevenLabs API استخدام Scribe لتفريغ الصوت وتوقيت الكلمات.
yt-dlp اختياري تنزيل مصادر فيديو من الإنترنت عندما تكون هناك حاجة لذلك.

وهنا توجد نقطة يجب الانتباه لها: وصف المشروع بأنه «100% مفتوح المصدر» يشير إلى كود video-use نفسه، لكنه لا يعني بالضرورة أن كل خدمة يعتمد عليها مجانية. التثبيت الرسمي يطلب مفتاح ElevenLabs API لعملية التفريغ، وبالتالي قد توجد تكلفة أو حصة استخدام مرتبطة بالخدمة الخارجية بحسب حساب المستخدم.

ماذا يحدث بعد التثبيت؟

يطلب README الرسمي استنساخ المستودع، ربط مجلد المشروع بمجلد Skills الخاص بالوكيل، تثبيت الاعتماديات، والتأكد من وجود FFmpeg. بعد ذلك تضع اللقطات الخام في مجلد عمل وتطلب من الوكيل تحريرها.

النتائج لا تكتب داخل مجلد الأداة نفسها. ينشئ video-use مجلد edit بجوار ملفات الفيديو المصدرية، ويضع الملفات الناتجة داخله، ومن بينها final.mp4. هذا التنظيم يساعد على إبقاء الكود منفصلًا عن مشروعات المستخدم وملفاتها.

أين تختلف الفكرة عن Premiere أو DaVinci Resolve؟

المقارنة المباشرة ليست عادلة تمامًا، لأن video-use لا يحاول إعادة بناء واجهة Premiere Pro أو DaVinci Resolve. الأدوات التقليدية تمنح المحرر تحكمًا بصريًا مباشرًا ودقيقًا في كل Frame وLayer وKeyframe. هذا ضروري في المونتاج المعقد والإعلانات والأعمال السينمائية.

أما المشروع الجديد فيحاول نقل جزء مختلف من العمل إلى اللغة الطبيعية: اختيار أفضل المحاولات، تنظيف الكلام، ترتيب المقاطع، إضافة ترجمة، تنفيذ Color Grade معتاد، وإنتاج نسخة أولى أو حتى نهائية في أنواع محتوى يمكن وصف قواعدها بالكلام.

ولمن يريد مقارنة الفكرة بأدوات المونتاج التقليدية، نشر سوالف سابقًا دليل أفضل برامج تحرير الفيديو المجانية الذي يضم DaVinci Resolve وShotcut وغيرهما من البرامج المبنية حول Timeline تقليدي.

فكرة المشروع تشبه ما حدث مع البرمجة

قبل سنوات كان استخدام الذكاء الاصطناعي في البرمجة يعني إكمال سطر أو اقتراح دالة. ثم ظهرت Coding Agents تستطيع قراءة المشروع وتشغيل الأوامر وتعديل عدة ملفات ومراجعة النتيجة. video-use يحاول تطبيق المنطق نفسه على المونتاج: بدل أن يكتب الوكيل Code فقط، يستخدم Code وأدوات النظام لإنجاز عمل إبداعي له مخرَج مرئي.

وهذه النقلة تفسر اختيار Browser Use لبنية Skills بدل بناء برنامج مونتاج مغلق. المشروع نفسه يصبح مجموعة معرفة وأدوات يمكن لوكلاء مختلفين استخدامها، بدل ربطه بنموذج واحد أو واجهة واحدة.

أين تبدو الأداة مناسبة أكثر؟

  • فيديوهات Talking Head التي تحتوي على محاولات وتوقفات كثيرة.
  • المقابلات والبودكاست المرئي التي تحتاج إلى تنظيف الحوار.
  • فيديوهات إطلاق المنتجات والشروحات القصيرة.
  • المونتاجات التي تحتاج إلى قص أولي سريع قبل المراجعة البشرية.
  • صناع المحتوى الذين ينتجون نمطًا متكررًا ويريدون حفظ قواعده بين الجلسات.

في المقابل، الأعمال التي تعتمد على قرارات بصرية دقيقة جدًا لحظة بلحظة أو مؤثرات معقدة قد تظل أكثر ملاءمة لأداة تحرير متخصصة مع محرر بشري يتحكم مباشرة في Timeline.

لماذا لفت هذا المشروع الانتباه على GitHub؟

عند إعداد هذه المادة تجاوز المستودع 27 ألف نجمة و3 آلاف Fork على GitHub. هذه الأرقام لا تثبت وحدها أن كل قرار مونتاج ينتجه video-use سيكون جيدًا، لكنها تكشف عن اهتمام كبير بفكرة تحرير الفيديو بواسطة Coding Agents بدل إضافة محرر فيديو تقليدي آخر إلى السوق.

كما أن المشروع منشور بترخيص MIT، ما يسمح للمطورين بدراسة الكود وتعديله وبناء استخدامات أخرى فوقه وفق شروط الترخيص. المستودع يتضمن Skills وأدوات مساعدة واختبارات، وليس مجرد Demo مغلق أو صفحة تستعرض فكرة لا يمكن تشغيلها.

الفكرة الأهم ليست أن الذكاء الاصطناعي أصبح «مونتيرًا» كاملًا

القيمة الحقيقية في video-use هي تحويل الفيديو إلى مادة يستطيع الوكيل التفكير فيها دون ابتلاع كل Frames الفيلم. التفريغ النصي يمثل الطبقة الأساسية، والصور المركبة تظهر فقط عند نقاط القرار، وFFmpeg ينفذ العمل النهائي. هذا الفصل بين «الفهم» و«التنفيذ» هو ما يجعل المشروع مثيرًا تقنيًا.

وهو أيضًا يوضح حدود الفكرة الحالية: القرارات تبدأ من الصوت، ثم تأتي الصورة لتأكيدها. هذا ممتاز للمحتوى القائم على الكلام، لكنه ليس بالضرورة المنهج المثالي لكل أنواع الفيديو. المشروع نفسه يقول إنه لا يفترض نوع المحتوى مسبقًا، ويطلب من الوكيل النظر إلى المادة وسؤال المستخدم قبل التحرير.

يمكن تجربة المشروع أو مراجعة كوده من مستودع video-use الرسمي على GitHub. وحتى لمن لا يريد تثبيته، فإن طريقة تصميمه تقدم تصورًا مثيرًا لما قد يصبح عليه المونتاج في السنوات المقبلة: بدل تعلم مكان كل زر، تخبر الوكيل بما تريد، يشرح لك خطته، توافق عليها، ثم يعود إليك بالفيديو ليبدأ النقاش التالي من النتيجة نفسها.

لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر

الأسئلة الشائعة

استضافة مجانية استضافة محتوى

Ayman abdallah

مؤسس ومدير تنفيذي لمشروع [محتوى] للمواقع العربية، مدير ادارة المحتوى في شركة Super App والرئيس التنفيذي ومدير التحرير والاعلانات لموقع سوالف سوفت.

اقرأ أيضا:

اترك تعليقاً

زر الذهاب إلى الأعلى