MiniMax H3 يحول المطالبات متعددة الوسائط إلى فيديوهات قابلة للنشر بدقة 2K مع صوت أصلي

تتطور نماذج توليد الفيديو بسرعة، لكن معظمها لا يزال يعمل مثل مولّدات اللقطات. فهي تُنتج مقطعًا وتترك المبدعين ليتعاملوا بأنفسهم مع الترجمة، والخطوط، والانتقالات

发布于 2026年8月3日generalGEO 评分: 06 次阅读
MiniMax H3 يحول المطالبات متعددة الوسائط إلى فيديوهات قابلة للنشر بدقة 2K مع صوت أصلي

MiniMax H3 يحوّل المطالبات متعددة الوسائط إلى فيديو 2K قابل للنشر

مقدمة

تتطور نماذج توليد الفيديو بسرعة، لكن معظمها لا يزال في مستوى مولدات المواد الخام. فهي تُنتج مقطعًا، ثم يترك المصمم ليتولى بنفسه معالجة الترجمة، والتخطيط، والانتقالات، وتصحيح الألوان، والموسيقى، والإيقاع، والمؤثرات البصرية في تطبيق تحرير آخر.

صُمم MiniMax H3 تحديدًا لتغيير سير العمل هذا.

أُطلق H3 في 31 يوليو 2026، وهو نموذج فيديو متعدد الوسائط عام يمكنه قبول مدخلات نصية وصور وفيديو وصوت في نفس السياق. يمكنه توليد فيديو متزامن مع صوت ستيريو من 4 إلى 15 ثانية، بدقة إخراج تصل إلى 768p أو 2K كحد أقصى.

تقول MiniMax إن النموذج صُمم للمشاركة في عملية إنتاج المحتوى الكاملة، وليس فقط توليد المواد الخام. تشمل حالات الاستخدام المستهدفة الإعلانات والعلامات التجارية والتجارة الإلكترونية وتصميم المنتجات وواجهات المستخدم وتجربة المستخدم والألعاب والملصقات المتحركة والتسلسلات الافتتاحية ومحتوى وسائل التواصل الاجتماعي.

تضع MiniMax نموذج H3 كنموذج مفتوح الأوزان وعام ومتعدد الوسائط للفيديو.

يصف التقرير الأصلي هذا التحول بأنه لحظة "البرمجة" لتوليد الفيديو. هذا التشبيه ليس حرفيًا، لكن الفكرة قيّمة: يمكن للمبدعين بشكل متزايد وصف النتيجة المرجوة وتقديم مواد مرجعية وفحص المخرجات والتكرار عبر أوامر اللغة الطبيعية، دون الحاجة إلى بناء كل طبقة يدويًا.

حالة الأوزان مفتوحة المصدر: قالت MiniMax في البداية إن الأوزان ستُطرح خلال أيام. نقاط فحص H3-Base الرسمية متاحة الآن على Hugging Face، بموجب ترخيص مجتمع MiniMax H3. ومع ذلك، فإن H3-Context-IR وH3-Regenerate-2K وتنفيذ الانتباه المتفرق غير مشمولة جميعها في إصدار الأوزان الأولي.

MiniMax H3 يظهر كنموذج لإنتاج الفيديو من البداية إلى النهاية

الأمثلة المبهرة الأولية لم تكن مجرد لقطات سينمائية بسيطة. شملت طباعة متحركة، وتأثيرات مرسومة يدويًا، ورسومات منتجات، وتسلسلات افتتاحية متحركة، وموسيقى، وحوارًا، وانتقالات.

هذه تُعد عادةً مهام منفصلة لمرحلة ما بعد الإنتاج.

قد يبدو سير العمل التقليدي كما يلي:

  1. توليد أو تسجيل المواد الخام.
  2. استيراد المقاطع إلى برنامج التحرير.
  3. فرز اللقطات القابلة للاستخدام.
  4. إضافة القص والانتقالات.
  5. تصميم العناوين والترجمات.
  6. إضافة الموسيقى والمؤثرات الصوتية.
  7. ضبط الإيقاع والألوان.
  8. تصدير النسخة النهائية.

يحاول H3 دمج العديد من هذه القرارات في نمذجة واحدة.

يمكن أن يصف المطالبة النمط البصري وتسلسل اللقطات والإيقاع والنص على الشاشة وتوجيهات الأداء والمشهد الصوتي والانتقالات. يمكن أن توفر الملفات المرجعية الشخصيات والمنتجات والحركة وأسلوب التصوير والصوت والموسيقى التصويرية أو إيقاع المونتاج.

صورة تعرض نتائج الاختبارات المبكرة لـ MiniMax H3. على اليسار تغريدة من TSUBAKI تعرض مقطع فيديو من إنتاج MiniMax H3 يتضمن شخصيات ونصوصًا متحركة وعناصر خلفية، بمدة دقيقة و11 ثانية وحصل على 31 ألف مشاهدة. على اليمين تغريدة من padiphone تعرض راديو أبيض، بمدة دقيقة و21 ثانية وحصل على 15.5 ألف مشاهدة. تعكس هذه الفيديوهات قدرة MiniMax H3 على تحويل المطالبات متعددة الوسائط إلى مقاطع فيديو نهائية بدقة 2K، بما يتوافق مع ما ذُكر في السياق عن قدرة H3 على إنتاج محتوى قصير أقرب إلى المنتج النهائي.

المختبِرون الأوائل استخدموا H3 لصنع فيديوهات بشخصيات منمقة ومنتجات راقية للإعلانات.

لا يعني ذلك أن برامج التحرير الاحترافية أصبحت قديمة. فالمشاريع الأطول ما تزال تحتاج إلى تحكم دقيق في الخط الزمني وإدارة الأصول والتعديلات والمراجعة القانونية وتسليم بصيغ متعددة.

التغيير المهم هو أن النموذج يمكنه الآن إنتاج مواد فيديو قصيرة أقرب إلى المنتج النهائي في عملية توليد واحدة.

اختبار H3 باستخدام فيديو ترويجي ومطالبات متعددة اللقطات سريعة

اختبر المؤلف الأصلي H3 عبر واجهة Hailuo من MiniMax.

التجربة الأولى كانت فيديو كواليس لمجموعة فتيان خيالية، ببطولة شخصيات معروفة في صناعة الذكاء الاصطناعي. وصفت المطالبة النصية الأسلوب المتوقع وإيقاع المونتاج، بينما تولى H3 توليد التسلسل البصري.

ثم اختبر المؤلف مقطع فيديو إعلانيًا بجمالية عرض على غرار أسلوب آبل. أُضيفت علامات أسلوب قصيرة فقط، ومع ذلك شملت النتيجة تأثيرات زجاج شفاف وتدرجات ورسومات متحركة وإيقاعًا يشبه العروض التقديمية.

اختبار أكثر تحديًا استخدم مطالبة طويلة لوصف إعلان ترويجي من ست لقطات. لكل لقطة اتجاه عاطفي خاص بها وتوجيهات أداء وإيقاع خاص.

وفقًا للتقرير، التزم H3 بتسلسل اللقطات بدقة، مولّدًا مونتاجًا سريعًا بمشاهد مميزة، بدلًا من ضغط التعليمات في مقطع واحد عام.

هذه المهمة تختبر قدرات متعددة في آن واحد:

  • التخطيط متعدد اللقطات
  • اتساق الشخصيات والمشاهد
  • اتباع المطالبة
  • الأداء العاطفي
  • حركة الكاميرا
  • إيقاع المونتاج
  • تصميم الانتقالات
  • مزامنة الصوت والصورة

النتائج ما تزال عروضًا ذاتية وليست معايير مضبوطة. نجاح حالة على وسائل التواصل لا يضمن نجاح كل مطالبة طويلة من المحاولة الأولى.

ومع ذلك، فمن الواضح أن النموذج أكثر ملاءمةً للتعليمات الإبداعية المنظمة مقارنةً بأنظمة الفيديو القديمة التي كانت تتوقع فقط أوصافًا نصية قصيرة.

عرض النصوص هو من أكثر ميزات H3 قيمةً تجاريًا

كانت النصوص دائمًا من أكثر النقاط هشاشةً في الفيديو المولَّد بالذكاء الاصطناعي.

نماذج الصور تحتاج فقط إلى عرض كلمة واحدة بشكل صحيح في إطار واحد. نماذج الفيديو يجب أن تحافظ على نفس الحروف عبر عشرات الإطارات بينما تتحرك الكاميرا والأسطح والإضاءة والمشهد المحيط باستمرار.

أي خطأ صغير في أي إطار قد يؤدي إلى وميض أو أخطاء إملائية أو طباعة غير مستقرة.

أظهرت الاختبارات الأصلية أن H3 وصل إلى مستوى قابل للاستخدام في:

  • العناوين المتحركة
  • الطباعة الترويجية
  • فيديوهات كلمات الأغاني
  • أسماء العلامات التجارية
  • ملصقات المنتجات
  • الترجمات
  • الرسومات النصية المتحركة
  • مرئيات واجهات المستخدم والويب

كما أدرجت MiniMax في مواد الإطلاق الرسمية عرض النصوص والعلامات التجارية بدقة كقدرة أساسية.

النموذج لا يضمن إنتاج نصوص مثالية في كل مرة. النصوص الصغيرة والجمل الطويلة والخطوط الخاصة والحركة المعقدة قد تظل تسبب أخطاء.

القيمة الأكبر في H3 تكمن في قدرته على نمذجة العلاقة بين النص والمشهد.

في أحد الأمثلة، أظهر النص المرتبط بعقد من الألماس تأثيرات انعكاس الضوء وعمق الميدان، بدلًا من كونه طبقة مسطحة بسيطة. هذا أقرب إلى التركيب البصري منه إلى مجرد وضع ترجمة.

بالنسبة للفرق التجارية، غالبًا ما تكون الطباعة الموثوقة أكثر قيمة من لقطات الكاميرا السينمائية المبهرة. الإعلانات وإطلاق المنتجات ومحتوى وسائل التواصل الاجتماعي كلها تعتمد على معلومات قابلة للقراءة.

الصوت الأصلي: الربط بين الكلام والمؤثرات الصوتية والموسيقى

يولّد H3 الصوت والفيديو معًا.

توضح بطاقة النموذج الرسمية ما يلي:

  • صوت ستيريو بتردد 32 كيلوهرتز
  • دعم ثابت للحوار بـ 11 لغة
  • نمذجة أصلية للكلام والموسيقى والمؤثرات الصوتية
  • توليد سمعي بصري مشترك، وليس مرحلة معالجة صوتية منفصلة لاحقة

اللغات المدعومة للحوار وفقًا لـ MiniMax تشمل:

  • العربية
  • الصينية
  • الإنجليزية
  • الفرنسية
  • الألمانية
  • الإيطالية
  • اليابانية
  • الكورية
  • البرتغالية
  • الروسية
  • الإسبانية

لغات أخرى قد تعمل أيضًا لكن بجودة متفاوتة.

يشير التقرير الأصلي أيضًا إلى أن المستخدم يمكنه تقديم صوت كمرجع. يمكن لـ H3 دمج مقاطع كلام أو موسيقى أو مواد صوتية أخرى مع الصور والفيديو المرجعي.

في واجهة برمجة التطبيقات الحالية، لا يمكن استخدام الصوت كمدخل مرجعي وحيد؛ يجب تقديم صورة أو فيديو أيضًا.

هذا التكامل مهم لأن الكلام المولَّد يجب أن يطابق إيقاع المشهد وعاطفته. التعليق الصوتي المضاف بعد إنتاج الفيديو قد يبدو صحيحًا لكنه قد ينفصل عن حركات الوجه أو الإيقاع أو انتقالات اللقطات.

تصميم H3 السمعي البصري الأصلي يهدف إلى إبقاء هذه العناصر متوافقة.

التسعير: 0.13 دولار لكل ثانية من فيديو 2K

تسعّر MiniMax نموذج H3 بناءً على مدة الفيديو المولَّد.

معدلات الدفع حسب الاستخدام العالمية الحالية:

المخرَج السعر
فيديو 2K 0.13 دولار لكل ثانية
فيديو 768p 0.08 دولار لكل ثانية
إعادة توليد من 768p إلى 2K 0.05 دولار لكل ثانية من المخرَج
مدخلات H3-Context-IR 0.90 دولار لكل مليون توكن
مخرجات H3-Context-IR 3.60 دولار لكل مليون توكن

وفقًا للمعدلات الحالية، تبلغ تكلفة التوليد المباشر لعشر ثوانٍ تقريبًا:

| الدقة |

التكلفة التقريبية للمخرجات |
|-|-|
| 768p | 0.80 دولار |
| 2K | 1.30 دولار |

تتبع فوترة المدخلات المرجعية قواعد منفصلة:

  • المرجع الصوتي مجاني.
  • أول خمس صور مرجعية مجانية.
  • عند التوليد المباشر، تُحتسب رسوم 0.04 دولار عن كل صورة بعد الصور الخمس الأولى.
  • الفيديو المرجعي يُفوتر وفقًا لمدته ودقة المخرجات المحددة.

المقال المصدر اقتطع التسعير الأصلي لمدخلات ومخرجات H3.

توضح لقطة الشاشة أعلاه أن سعر توليد 768p يبلغ 0.09 دولار في الثانية. صفحة التسعير العالمية الحالية لـ MiniMax تعرض الآن 0.08 دولار في الثانية، لذا يجب الاعتماد على الوثائق الرسمية المباشرة كمصدر حالي للمعلومات.

تدّعي MiniMax أنه بدقة 2K، تبلغ تكلفة H3 أقل من ثلث تكلفة المنافسين الرئيسيين؛ وبدقة 768p، تقل التكلفة عن نصف تكلفة نماذج 720p الرئيسية.

تعتمد هذه المقارنة على المنافسين والإعدادات التي اختارتها MiniMax. التكلفة الفعلية لكل فيديو صالح تعتمد على عدد مرات إعادة المحاولة، والمواد المرجعية، وطول المقطع، وإعادة التوليد، وما إذا كان المخرَج الأول قابلًا للاستخدام مباشرة.

H3 يحتل المرتبة الأولى في قائمة Artificial Analysis لتحرير الفيديو

تصنف Artificial Analysis حاليًا MiniMax H3 في المرتبة الأولى في قائمتها لتحرير الفيديو مع الصوت.

في وقت كتابة هذا المستند، يظهر الترتيب على النحو التالي:

الترتيب النموذج Elo سعر API
1 MiniMax H3 1,129 7.80 دولار/الدقيقة
2 Gemini Omni Flash 1,122 6.00/الدقيقة
3 HappyHorse-1.0 1,096 27.04 دولار/الدقيقة
4 Wan 2.7 1,080 16.90 دولار/الدقيقة
5 Dreamina Seedance 2.0 720p 1,037 5.57 دولار/الدقيقة

المقال المصدر وضع H3 في صدارة قائمة Artificial Analysis لتحرير الفيديو.

يتصدر H3 أيضًا اختبارات توليد الفيديو من النص ومن الصورة.

تتغير نتائج القوائم مع إضافة نماذج جديدة وتصويتات جديدة. وهي تقيس تفضيلات الجمهور على مجموعة محددة من المطالبات، ولا ينبغي اعتبارها دليلًا على ملاءمة نموذج معين لجميع سير العمل الإنتاجي.

ومع ذلك، تظل هذه النتيجة جديرة بالاهتمام لأن H3 يجمع بين تقييمات تحرير قوية وأوزان أساسية منشورة، بينما تظل العديد من نماذج الفيديو الرائدة مغلقة.

نظام مدخلات متعدد الوسائط موحد

لا يتعامل H3 مع النصوص والصور والفيديو والصوت كوسائط مدخلات منفصلة وغير مترابطة.

بل يتعامل معها كسياق موحد متعدد الوسائط، ويحاول فهم العلاقة بين هذه المواد والمخرجات المطلوبة.

على سبيل المثال، يمكن لمطالبة أن تطلب من H3:

  • استخدام حركة الكاميرا من فيديو معين
  • الحفاظ على الشخصيات الظاهرة في صورة ما
  • استخدام الصوت من مرجع صوتي
  • اتباع إيقاع مقطع آخر
  • تطبيق نمط عناوين محدد
  • توليد مشهد جديد يجمع كل هذه العلاقات

يدعم API الرسمي حاليًا:

نوع المرجع الحد الأقصى
الصور حتى 9 صور
مقاطع الفيديو حتى 3 مقاطع
المقاطع الصوتية حتى 3 مقاطع
إجمالي الملفات المختلطة حتى 12 ملفًا

يجب أن يتراوح طول مقاطع الفيديو والصوت المرجعية بين 2 و15 ثانية، مع حد أقصى إجمالي للمدة قدره 15 ثانية لكل نوع وسائط.

الحد الأقصى للمطالبة هو 7,000 حرف.

تعرض هذه الصورة واجهة ميزة إنشاء الفيديو في MiniMax H3، حيث توجد في أعلى الواجهة ثلاثة خيارات: "إنشاء فيديو" و"إنشاء صورة" و"هيلو Agent"، مع تحديد خيار "إنشاء فيديو". يعرض منتصف الواجهة نص "H3 متاح رسميًا، دع الإلهام يتحول إلى فيلم"، ويوجد بالأسفل منطقة إدخال تتضمن زر إضافة مرجع ومعايير معلمات التوليد وزر "إنشاء"، بالإضافة إلى مثال توضيحي لمطالبة توليد الفيديو. تتوافق هذه الواجهة مع المحتوى المذكور في الوثيقة حول قدرة MiniMax H3 على تحويل المطالبات متعددة الوسائط إلى فيديو بدقة 2K، وتجسد هذه الواجهة نقطة الدخول وتصميم واجهة عملية إنشاء الفيديو لهذا المنتج.

واجهة Hailuo تجمع بين المطالبات والمراجع متعددة الوسائط والدقة والمدة ونسبة العرض إلى الارتفاع.

هذا التصميم يجعل المواد المرجعية أكثر أهمية من كتابة مطالبات طويلة جدًا.

يمكن للنص وصف تأثير الإضاءة المطلوب، لكن الصورة المرجعية يمكنها نقل نفس التأثير البصري بشكل أكثر مباشرة. يمكن للوصف النصي شرح حركة معينة، لكن الفيديو المرجعي يمكنه إظهار التوقيت الدقيق.

تكمن قيمة النموذج في تفسير كيفية إعادة دمج هذه المراجع، وليس مجرد نسخها.

المواد الحديثة تقلل من إعادة الرفع المتكررة

أبرز المقال المصدر ميزة عملية صغيرة لكنها مفيدة: تظهر المواد المرفوعة في لوحة الاستخدام الحديث.

تعرض الصورة واجهة توليد الفيديو في MiniMax H3. تظهر فيها نسبة تقدم الرفع 99% وجارٍ توليد الفيديو. يوجد على اليسار زرا "رفع" و"اختيار الأصول"، وفي الأسفل منطقة "المراجع" تعرض عدة صور لأشخاص، مع تحديد إحداها كمرجع (2/12). على اليمين يوجد وصف توليد الفيديو الذي يتضمن إعداد المشهد ووصف الصوت والتفاصيل الفنية. تتصل هذه الصورة بالسياق مباشرة، وتعرض بشكل مرئي واجهة توليد الفيديو باستخدام MiniMax H3 وبعض خطوات التشغيل.

يمكن إعادة استخدام الصور والمراجع المرفوعة سابقًا من لوحة المواد الحديثة.

هذا عملي لأولئك الذين يستخدمون نفس الشخصيات أو المنتجات أو الشعارات أو النغمات اللونية أو الأصوات أو الأساليب البصرية أو المواقع أو المراجع الحركية بشكل متكرر.

فهو يقلل من الحاجة إلى رفع وتنظيم نفس الملفات في كل مرة توليد.

كيف يفهم H3 النية الإبداعية

تصف MiniMax H3 كنظام مبني حول تعميم المهام، وليس كمجموعة من النماذج المتخصصة المستقلة.

غالبًا ما قسمت الأنظمة التوليدية المبكرة العمل الإبداعي إلى مهام منعزلة مثل النص إلى فيديو، أو الصورة إلى فيديو، أو توليد الإطارات الأولى والأخيرة، أو مرجع الشخصية، أو مرجع الأسلوب، أو نقل الحركة، أو مرجع الصوت، أو تحرير الفيديو، أو توليد المؤثرات الصوتية، أو توليد الموسيقى.

تم تدريب H3 على التعبير عن هذه العلاقات من خلال اللغة الطبيعية في نظام متعدد الوسائط واحد.

يتضمن سير العمل الكامل عبر الإنترنت لـ H3 ثلاثة وحدات رئيسية:

مدخلات متعددة الوسائط
      ↓
H3-Context-IR
      ↓
H3-Base (768p)
      ↓
H3-Regenerate-2K
      ↓
الفيديو النهائي (بصوت ستيريو)

H3-Context-IR

H3-Context-IR هو نظام معالجة مسبقة وتنسيق مُدار.

يحلل العلاقات بين النصوص والصور والفيديو والصوت، ثم يولّد تمثيلًا وسيطًا منظمًا يمكن لـ H3-Base استخدامه.

يمكن لهذا النظام تنفيذ تحليل التعليمات، والربط بين الوسائط، والتحليل الزمني، وتفكيك المشاهد، ونمذجة العلاقات بين الصوت والفيديو، واستكمال التفاصيل المفقودة في المطالبات، والاستدلال المنطقي المعقد.

تشير المدونة التقنية لـ MiniMax إلى أن بعض المواد المصدرية تتطلب نحو 100,000 رمز من الحوسبة الاستدلالية قبل تقطيرها إلى تمثيل سياقي متوسط يبلغ حوالي 4,000 رمز.

لا يتم تضمين H3-Context-IR في إصدار الأوزان مفتوحة المصدر الأولي لأنه يعتمد على نماذج وخدمات مُدارة متعددة.

توفر MiniMax هذه الوظيفة عبر واجهة برمجة التطبيقات (API)، وتنشر دليلًا توجيهيًا للفرق التي ترغب في بناء أنظمة معالجة مسبقة خاصة بها.

H3-Base

يولّد H3-Base فيديو وصوتًا ستيريو بدقة 768p.

تُرمَّز المدخلات المختلفة عبر مُرمِّزات أو شبكات VAE المناسبة، وتُجمَّع في تسلسل موحّد متعدد الوسائط، ثم تُرسَل إلى محول H3-Omni.

يوفّر النموذج المُصدَر نقطتي فحص مخصصتين لمهمتين:

نقطة الفحص المهمة الرئيسية
H3-Base-FL2VA تحويل النص إلى فيديو وتحويل الإطار الأول/الأخير إلى فيديو
H3-Base-Ref2VA توليد فيديو وصوت بناءً على مراجع

تستخدم كلتا نقطتي الفحص دقة BF16.

H3-Regenerate-2K

لا يُعد سير عمل H3 بدقة 2K أداة تقليدية لرفع الدقة الفائقة.

تُعاد نتائج 768p والسياق متعدد الوسائط الأصلي إلى H3، مما يتيح للنموذج إعادة توليد المخرجات بدقة أعلى.

تسمّيها MiniMax إعادة التوليد داخل السياق.

تحاول أنظمة رفع الدقة التقليدية استنتاج التفاصيل المفقودة من الفيديو منخفض الدقة. بينما يمكن لـ H3 إعادة استخدام المطالبة الأصلية والمعلومات المرجعية، مما قد يساعدها على استعادة النصوص الصغيرة وتفاصيل المنتج ومعلومات المشهد بدقة أكبر.

لا يتضمن H3-Regenerate-2K في الإصدار الأولي من الأوزان مفتوحة المصدر. وهو متاح حاليًا عبر سير العمل المُدار وواجهة برمجة التطبيقات من MiniMax.

المكونات التقنية الأساسية لـ H3

حددت MiniMax أربع تقنيات رئيسية وراء النظام.

التمثيل متعدد الوسائط الكامل للسياق

في مطالبات الفيديو التقليدية، يصف نص توضيحي المقطع المستهدف.

أما في H3،

فيجب أن يوضح التسمية التوضيحية أيضًا علاقة كل مرجع بالمخرج، والعلاقات المتبادلة بين المراجع، وأي حركة يجب أن تأتي من أي فيديو، وأي صوت ينتمي إلى أي شخصية، وكيف يتغير الصوت عبر اللقطات المتعددة، وما الذي يجب الاحتفاظ به أو تحريره.

اللغة هي الجسر الذي يربط هذه العلاقات متعددة الوسائط.

بنَت MiniMax نماذج متخصصة وخط أنابيب فهم متعدد الوسائط بالكامل لتوليد هذا التمثيل.

H3-VAE

يستخدم H3 فضاءات كامنة منفصلة للرؤية والصوت.

شبكة VAE البصرية هي مُرمِّز فيديو سببي زمنيًا، بضغط مكاني 16x، وضغط زمني 4x، و24 قناة كامنة، مع معالجة إضافية بالتجزئة قبل المحول.

صرّحت MiniMax أن شبكة VAE الجديدة توفر تحسينًا بمقدار 4 أضعاف في طول التسلسل الفعّال مقارنة بأساليبها السابقة، مما يقلل تكاليف التدريب والاستدلال، ويدعم في الوقت نفسه التوليد الأصلي بدقة 2K.

تعالج شبكة VAE الصوتية قنوات الاستريو اليسرى واليمنى بشكل مستقل أولاً، ثم تعيد دمجها. وتضغط الصوت بتردد 32 كيلوهرتز إلى رموز كامنة بمعدل 40 هرتز لكل قناة.

H3-Omni Transformer

محول H3-Omni هو محول أحادي التدفق كثيف.

تدرج بطاقة النموذج الرسمية:

  • إجمالي 33 مليار معامل
  • حوالي 13 مليار معامل في الفروع المرتبطة بـ AdaLN
  • تنبؤ مشترك للمتغيرات الكامنة للفيديو والصوت
  • تضمينات موضعية دورانية ثلاثية الأبعاد متعددة الوسائط
  • آلية انتباه موحدة وطبقات تغذية أمامية بدون وحدات خاصة بالوسائط

تذكر MiniMax أن مخرجات تعديل AdaLN يمكن حسابها مسبقًا وتخزينها مؤقتًا، لذا فإن النشر المخصص للاستدلال فقط لا يتطلب تحميل هذه المعاملات.

يفصل النموذج بين مهام الفهم والتوليد أثناء التدريب للتعامل بشكل أفضل مع التغيرات الكبيرة في أطوال التسلسلات متعددة الوسائط. وذكرت MiniMax أن هذا حسّن إنتاجية التدريب من البداية إلى النهاية بنحو 30%.

الانتباه المتفرق

يستخدم H3 انتباهًا متفرقًا أصليًا أثناء التدريب لتقليل تكلفة التسلسلات الطويلة متعددة الوسائط.

يستخدم الإصدار الأولي من الأوزان مفتوحة المصدر حاليًا انتباهًا كاملاً للاستدلال. وتذكر MiniMax أن تنفيذ الانتباه المتفرق سيُصدَر في تحديث مستقبلي.

يُعد هذا التمييز مهمًا للنشر المحلي، لأن التطبيقات المتاحة حاليًا قد تتطلب موارد حوسبة أكبر من حزمة الخدمات المحسّنة داخليًا لدى MiniMax.

الأوزان المفتوحة: ما تم إصداره فعليًا

أصدرت MiniMax أوزان H3-Base على Hugging Face بموجب ترخيص مجتمع MiniMax H3.

تتضمن المستودعات H3-Base-FL2VA وH3-Base-Ref2VA وملفات المعالج وملفات الرموز ومُرمِّز النص وأوزان محول Omni وشبكتي VAE البصرية والصوتية ونصوصًا برمجية وأدلة نشر وأمثلة قابلة لإعادة الإنتاج بدقة 768p.

تستخدم نقاط الفحص الأوزان المدربة بالكامل لنموذج Qwen3-VL-32B باعتباره مُرمِّز H3، وتُمرِّر الحالة المخفية من طبقته الخمسين إلى محول H3-Omni.

يمكن تنزيل النموذج عبر الأمر التالي:

hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3

تدرج MiniMax أطر العمل SGLang وvLLM وDiffusers وComfyUI كأطر عمل مدعومة أو موصى بها للاستدلال.

يستخدم مثال SGLang الخاص بها أربع وحدات معالجة رسومية:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \

--host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

هذا مثال رسمي وليس حدًا أدنى عامًا. تعتمد الذاكرة والأداء الفعليان على نقطة الفحص والمدة والدقة وطريقة التنفيذ والأجهزة.

النظام الكامل عبر الإنترنت لم يُفتح بالكامل بعد

قد يكون وصف H3 بأنه "مفتوح المصدر بالكامل" مضللًا.

تُعد أوزان H3-Base المُصدَرة كبيرة وتدعم التوليد المحلي بدقة 768p. ومع ذلك:

  • لا يزال H3-Context-IR نظامًا مُدارًا.
  • لم يُصدَر H3-Regenerate-2K بعد.
  • لا يتضمن الإصدار الأول استدلال الانتباه المتفرق.
  • يعتمد النموذج على ترخيص مجتمع MiniMax، وليس ترخيصًا قياسيًا متساهلًا مثل Apache 2.0.

يجب على الفرق مراجعة الترخيص وملاحظات البنية بعناية قبل التخطيط للنشر التجاري.

ومع ذلك، يُنشئ هذا الإصدار خيارات ذات مغزى للأصول ذات العلامات التجارية الخاصة. يمكن للشركات دراسة النموذج الأساسي وضبطه بدقة ونشره ضمن حدود شروط الترخيص، دون إرسال كل أصل مصدري إلى واجهة توليد تابعة لجهة خارجية.

استخدام MiniMax H3 عبر واجهة برمجة التطبيقات

تدعم واجهة برمجة التطبيقات الرسمية ثلاثة أوضاع توليد رئيسية:

  1. تحويل النص إلى فيديو
  2. تحويل صورة الإطار الأول/الأخير إلى فيديو
  3. التوليد بالمراجع متعددة الوسائط

سير عمل التوليد غير متزامن:

  1. إرسال المهمة واستلام task_id.
  2. الاستعلام عن حالة المهمة.
  3. الحصول على رابط الفيديو بعد نجاح المهمة.
  4. تنزيل النتيجة وحفظها.

يمكن للمطوّرين أيضًا استخدام واجهة الأوامر الرسمية من MiniMax:

npm install -g mmx-cli
mmx auth login
mmx video generate \
  --model MiniMax-H3 \
  --prompt "إعلان منتج احترافي مع خطوط متحركة"

لسير عمل المراجع متعددة الوسائط:

mmx video generate \
  --model MiniMax-H3 \
  --prompt "احتفظ بنفس الشخصية واتبع الحركة المرجعية" \
  --reference-image character.png \
  --reference-video motion.mp4

قبل الاستخدام في بيئة الإنتاج، يجب مراجعة توثيق واجهة الأوامر وواجهة برمجة التطبيقات، لأن حدود الإدخال والفوترة والمعاملات المدعومة قد تتغير.

أهمية H3 لإنتاج الفيديو

لا يلغي H3 جميع مهام ما بعد الإنتاج.

قد يظل المشروع التسويقي الاحترافي بحاجة إلى تحرير دقيق بإطار زمني محدد، ومراجعات العملاء، وموسيقى مرخصة، وفحوصات قانونية وحقوق نشر، والتزام دقيق بالعلامة التجارية، واستمرارية للأفلام الطويلة، وتصدير بنسب أبعاد متعددة، وإخراج للممثلين الحيين، وتسليم بإدارة الألوان.

ما يغيّره H3 هو نقطة البداية.

لم يعد المبدع يتلقى مادة صامتة، بل يحصل على أصل قصير يتضمن المونتاج والصوت والخطوط والتعليق الصوتي والمؤثرات البصرية والتوجيه البصري المميز.

يجعل هذا النموذج مناسبًا بشكل خاص لـ:

  • إعلانات وسائل التواصل الاجتماعي
  • الفيديوهات الترويجية للمنتجات
  • فيديوهات التجارة الإلكترونية
  • المرئيات الموسيقية
  • الملصقات الديناميكية
  • اختبارات مفاهيم العلامات التجارية
  • نسخ سريعة للحملات
  • الألعاب وواجهات المستخدم

فيديو مفاهيمي

يوضح هذا النموذج أيضًا أن توليد الفيديو أصبح بشكل متزايد أقل تقييدًا بمهام محددة. يمكن لنظام واحد أن يفسر بشكل متزايد مجموعة من الأصول الإبداعية وينفذ موجزًا إبداعيًا أكثر اكتمالًا.

الأسئلة الشائعة

ما هو MiniMax H3؟

MiniMax H3 هو نظام عام متعدد الوسائط لتوليد وتحرير الفيديو. يقبل مدخلات نصية وصور وفيديو وصوت، ويمكنه توليد مقاطع فيديو تتراوح مدتها من 4 إلى 15 ثانية مع صوت ستيريو متزامن.

هل يمكن لـ MiniMax H3 توليد فيديو بدقة 2K؟

نعم. تدعم واجهة برمجة التطبيقات المُدارة إخراج بدقة 2K. تتضمن العملية الكاملة أولاً توليد نتيجة بدقة 768p باستخدام H3-Base، ثم استخدام H3-Regenerate-2K لإعادة توليد الفيديو بدقة أعلى مع الحفاظ على السياق الأصلي.

هل MiniMax H3 مفتوح المصدر؟

أصدرت MiniMax أوزان H3-Base بموجب ترخيص المجتمع الخاص بها. لم يتم فتح النظام الكامل عبر الإنترنت بالكامل، لأن H3-Context-IR وH3-Regenerate-2K والاستدلال بالانتباه المتفرق لم تُضمَّن جميعها في الإصدار الأولي.

هل يمكن تشغيل MiniMax H3 محليًا؟

نعم، يمكن نشر نقاط تفتيش H3-Base المُصدرة محليًا لتوليد بدقة 768p. توفر MiniMax أمثلة SGLang وتوفر روابط لأعمال vLLM وDiffusers وComfyUI، لكن النموذج يتطلب موارد حاسوبية كبيرة.

كم تبلغ تكلفة واجهة برمجة تطبيقات MiniMax H3؟

السعر العالمي الحالي هو 0.13 دولار لكل ثانية مولّدة بدقة 2K، و0.08 دولار لكل ثانية بدقة 768p. قد تؤدي الصور المرجعية التي تتجاوز الخمس صور الأولى، والفيديو المرجعي، وإعادة التوليد، وH3-Context-IR إلى رسوم إضافية.

هل يولد H3 الصوت مع الفيديو؟

نعم. يولد H3 بشكل مشترك الفيديو وصوت ستيريو أصلي بتردد 32 كيلوهرتز، بما في ذلك الحوار والموسيقى والمؤثرات الصوتية.

كم عدد الملفات المرجعية التي يمكن أن يقبلها H3؟

تدعم واجهة برمجة التطبيقات حتى تسع صور وثلاثة مقاطع فيديو وثلاثة مقاطع صوتية، بإجمالي يصل إلى 12 ملفًا مختلطًا. كما توجد قيود على المدة وحجم الملف.

هل H3 مناسب لإنتاج الفيديو التجاري؟

صممت MiniMax H3 للاستخدام في الإعلانات والعلامات التجارية والتجارة الإلكترونية وتصميم المنتجات وواجهة المستخدم وتجربة المستخدم وأغراض تجارية أخرى. يجب على الفرق مراجعة المخرجات والتحقق من حقوق جميع المواد المدخلة ومراجعة ترخيص المجتمع وشروط المنصة.

الأدوات ذات الصلة

  • Hailuo AI: تطبيق الويب العالمي من MiniMax لإنشاء فيديوهات باستخدام H3.
  • MiniMax H3 على Hugging Face: أوزان H3-Base الرسمية وبطاقة النموذج وشرح البنية وأمثلة النشر المحلي.
  • MiniMax API: المنصة العالمية الرسمية لتوليد فيديوهات H3 عبر واجهة برمجة التطبيقات.
  • MiniMax CLI: أداة سطر الأوامر الرسمية لتوليد الفيديو والصور والصوت والموسيقى والنص.
  • SGLang: إطار خدمة الاستدلال المدعوم لأمثلة النشر المحلي لـ MiniMax H3.
  • ComfyUI: بيئة عمل مرئية قائمة على العقد، توفر برنامجًا تعليميًا رسميًا لتوليد فيديو H3.
  • Artificial Analysis Video Arena: لوحة صدارة تصويت أعمى لمقارنة نماذج تحرير الفيديو.

الروابط ذات الصلة

التسعير: التسعير الحالي لأجيال H3 والمدخلات المرجعية وإعادة التوليد وContext-IR.

الملخص

ينقل MiniMax H3 فيديو الذكاء الاصطناعي من توليد المقاطع المنفردة إلى مستوى أعلى، من خلال دمج التوليد البصري ومنطق التحرير وتركيب الترجمة والحوار والمؤثرات الصوتية والموسيقى والمراجع متعددة الوسائط داخل نظام واحد.

يمكن للإصدار المُدار توليد مقاطع فيديو تتراوح مدتها من 4 إلى 15 ثانية مع صوت ستيريو أصلي مدمج، وبدقة إخراج تصل إلى 2K. حاليًا، يحتل هذا الإصدار المرتبة الأولى في لوحة صدارة تحرير الفيديو من Artificial Analysis، ويوفر إخراج 2K عبر واجهة MiniMax العالمية بسعر 0.13 دولار لكل ثانية مولدة.

أصدرت MiniMax نقاط تفتيش H3-Base لدعم التوليد المحلي بدقة 768p والتطوير اللاحق. ومع ذلك، نظرًا لأن Context-IR وإعادة التوليد بدقة 2K والاستدلال بالانتباه المتفرق لم تُفتح جميعها، يظل سير العمل المُدار الكامل مغلقًا جزئيًا.

التحول الجوهري في H3 ليس فقط توليد صور بجودة أعلى، بل التطور من توليد مقطع إلى فهم وتنفيذ موجز إبداعي كامل لفيديو قصير.