إصدار MiniMax H3 رسميًا: نموذج فيديو متعدد الوسائط عام يدعم إخراج 2K وصوتًا ستيريو أصليًا

أصدرت MiniMax رسميًا نموذج MiniMax H3، وهو نموذج عام لتوليد الفيديو متعدد الوسائط، قادر على فهم النصوص والصور ومقاطع الفيديو والصوت ضمن إطار توليد موحد.

发布于 2026年7月31日generalGEO 评分: 08 次阅读
إصدار MiniMax H3 رسميًا: نموذج فيديو متعدد الوسائط عام يدعم إخراج 2K وصوتًا ستيريو أصليًا

إصدار MiniMax H3: نموذج فيديو متعدد الوسائط شامل يدعم إخراج 2K وصوت ستيريو أصلي

مقدمة

أعلنت MiniMax رسمياً عن إصدار MiniMax H3، وهو نموذج توليد فيديو متعدد الوسائط شامل، قادر على فهم النصوص والصور والفيديو والصوت ضمن سير عمل توليد واحد.

يمثل هذا الإصدار تحولاً جوهرياً، حيث لم يعد يُنظر إلى توليد الفيديو من النص، أو من الصور، أو توليد الفيديو بالرجوع إلى مراجع، أو مزامنة الصوت، أو التحرير، على أنها مهام منفصلة. بدلاً من ذلك، صُمم H3 ليكون قادراً على استقبال أنواع متعددة من السياقات في وقت واحد، واستخدام تعليمات اللغة الطبيعية لوصف كيفية تفاعل هذه المحتويات المرجعية مع بعضها البعض.

وفقاً لـ MiniMax، يدعم H3 إخراج فيديو بصوت ستيريو أصلي، ويمكنه توليد مقاطع يصل طولها إلى 15 ثانية، مع توفير إخراج بدقة 2K عبر الواجهة البرمجية الحالية (API).

تستهدف الشركة هذا النموذج لمجال إنشاء المحتوى التجاري، بما في ذلك الإعلانات والعلامات التجارية والتجارة الإلكترونية وتصميم المنتجات وتصميم واجهات المستخدم/تجربة المستخدم والألعاب.

صورة تعرض شابة تجلس خارج مقهى، ذات شعر أسود مجعد وبشرة بنية، ترتدي قميصاً أبيض ومئزراً أزرق، مع أساور ملونة على معصمها، وتحمل كوباً من القهوة. تظهر في الخلفية لافتة مقهى مكتوب عليها "CAFE"، وهناك زبائن آخرون يتناولون الطعام داخل المقهى أو خارجه. هذه الصورة مرتبطة بتقديم نموذج MiniMax H3 في المستند، وقد تُستخدم لعرض تطبيقاته في إنشاء المحتوى التجاري مثل الإعلانات والترويج للعلامات التجارية.

يركز هذا الإصدار أيضاً بشكل كبير على تكلفة التوليد. تقول MiniMax إن H3، مع الحفاظ على قدراته في التعامل مع المراجع متعددة الوسائط والإخراج عالي الدقة، تبلغ تكلفة التوليد في الثانية أقل من العديد من أنظمة توليد الفيديو الرئيسية.

H3: من مهام الفيديو المتخصصة إلى التوليد متعدد الوسائط الموحد

غالباً ما كانت نماذج الفيديو المبكرة منظمة حول سير عمل مستقل.

قد يختار منشئ المحتوى نموذجاً أو واجهة برمجية لتوليد الفيديو من النص، ونموذجاً آخر لتحريك الصور، ويستخدم عملية مختلفة تماماً لتحرير الفيديو بالرجوع إلى مراجع أو مزامنة الصوت.

يحاول H3 توحيد هذه الحالات الاستخدامية ضمن سياق متعدد الوسائط مشترك.

تصف وثائق API الحالية لـ MiniMax ثلاثة أوضاع توليد رئيسية:

وضع التوليد المدخلات الاستخدام النموذجي
توليد فيديو من نص مطالبة نصية توليد فيديو جديد بناءً على وصف نصي
توليد فيديو من صورة (إطار أول/أخير) مطالبة نصية مع إطار أول و/أو إطار أخير تحريك الصور أو التحكم في بداية ونهاية مقطع الفيديو
التوليد بالرجوع إلى مراجع مطالبة نصية مع صور وفيديو و/أو صوت الحفاظ على الموضوع، الحركة، أسلوب التصوير، الصوت، أو إيقاع المونتاج

وبالتالي، فإن النموذج لا يقتصر على تحويل جملة واحدة إلى فيديو.

يمكنه أيضاً دمج الوسائط المرجعية كجزء من سياق التوليد.

بالنسبة للتوليد بالرجوع إلى مراجع، تدعم واجهة MiniMax البرمجية المجموعات التالية:

  • حتى 9 صور مرجعية
  • حتى 3 فيديوهات مرجعية
  • حتى 3 مقاطع صوتية مرجعية
  • إجمالي يصل إلى 12 ملف وسائط

يمكن أن يصل إجمالي مدة الفيديو المرجعي إلى 15 ثانية، بينما يجب أن يكون الصوت مصحوباً بمرجع صورة أو فيديو واحد على الأقل.

تسمح هذه البنية لمنشئي المحتوى بوصف العلاقات بين المدخلات المختلفة دون الحاجة إلى معالجة كل وسيط يدوياً كمرحلة منفصلة.

اللغة الطبيعية جسر يربط بين الوسائط المختلفة

تصف مصادر أخبار AIBase أحد المفاهيم الأساسية لـ H3 بأنه التمثيل الشامل السياقي (Contextual Omni Representation).

الفكرة هي استخدام اللغة الطبيعية كجسر يربط بين

أنواع الوسائط المختلفة.

يمكن للمستخدمين تقديم مراجع متعددة في وقت واحد ووصف العلاقات المتوقعة بينها بلغة يومية.

على سبيل المثال، قد يتطلب سير عمل ما من H3 من الناحية المفاهيمية القيام بالتالي:

  • اتباع أسلوب حركة الكاميرا من فيديو مرجعي معين
  • الحفاظ على الشخصية الظاهرة في صورة مرجعية معينة
  • متابعة إيقاع أو صوت مرجع صوتي معين
  • تطبيق كل هذه القيود في وقت واحد على مشهد جديد تماماً

هذا يختلف جوهرياً عن مطالبة نصية بسيطة لتوليد فيديو.

يجب على النموذج فهم ليس فقط ما يحتويه كل مدخل وسائط، ولكن أيضاً الدور الذي يجب أن يلعبه كل مدخل في التوليد النهائي.

تعكس واجهة MiniMax البرمجية العامة هذا التصميم من خلال مدخلات متعددة الوسائط قائمة على الأدوار، مثل:

  • first_frame (الإطار الأول)
  • last_frame (الإطار الأخير)
  • reference_image (صورة مرجعية)
  • reference_video (فيديو مرجعي)
  • reference_audio (صوت مرجعي)

لا يزال يتعين على المستخدمين تقديم مطالبة نصية، ولكن يمكن أن تعمل هذه المطالبة كطبقة تعليمات فوق مصادر الوسائط المتعددة.

H3 يدعم صوت ستيريو أصلي وإخراج 2K لمدة تصل إلى 15 ثانية

تقول MiniMax إن H3 يمكنه توليد فيديو بصوت ستيريو أصلي مباشرة، دون الحاجة إلى استخدام عملية توليد صوت منفصلة لاحقاً.

تتضمن المعلومات المدرجة في وثائق المطورين الحالية:

  • اسم النموذج: MiniMax-H3
  • دقة الإخراج: 2K
  • مدة الإخراج: حتى 15 ثانية
  • نسب الأبعاد الشائعة: مدعومة
  • نسبة الأبعاد التكيفية: تنطبق على سير العمل المرجعي المناسب

يقبل مرجع API حالياً مدداً صحيحة تتراوح بين 4 و15 ثانية، بينما يصف دليل المطورين المتقدم النطاق الطبيعي للإخراج بأنه من 5 إلى 15 ثانية.

هذا الاختلاف الدقيق في التوثيق جدير بالملاحظة عند التطوير بناءً على API: يجب على المطورين اتباع نمط نقطة النهاية الحالي المطابق لحسابهم وSDK الخاص بهم.

للتوليد من نص فقط، يجب تحديد نسبة الأبعاد صراحةً.

تشمل نسب الأبعاد المدعومة في مرجع API الحالي:

  • 21:9
  • 16:9
  • 4:3
  • 1:1
  • 3:4
  • 9:16

يمكن لسير العمل المرجعي أيضاً استخدام أحجام تكيفية.

الاختبارات المبكرة تركز على إنشاء المحتوى التجاري

تقول MiniMax إن الاختبارات المبكرة أظهرت أداءً قوياً في عدة مجالات تطبيقية عملية.

تشمل هذه المجالات:

  • اتباع التعليمات
  • تقديم العلامات التجارية والنصوص
  • نقل الحركة من فيديو إلى فيديو
  • التوليد متعدد الوسائط
  • التحرير المتحكم به
  • الإنتاج الإبداعي التجاري

تسلط الشركة الضوء بشكل خاص على سيناريوهات التطبيق التالية:

  • الإعلانات
  • بناء العلامات التجارية
  • التجارة الإلكترونية
  • تصميم المنتجات
  • واجهات المستخدم/تجربة المستخدم (UI/UX)
  • الألعاب

تأتي هذه الأوصاف المتعلقة بالأداء من MiniMax نفسها ومن التقارير المتعلقة بالإصدار، وليس من معايير عامة مستقلة.

هذا التمييز مهم.

من الصعب تلخيص جودة توليد الفيديو في درجة واحدة بسيطة. قد يتفوق نموذج ما في نقل الحركة، لكنه يكون أضعف نسبياً في التفاصيل الدقيقة للوجه، أو الطباعة، أو اتساق الهوية على المدى الطويل، أو التفاعلات المعقدة بين الأجسام المتعددة.

لذلك، فإن الطريقة الأكثر موثوقية لتقييم مدى ملاءمة H3 للإنتاج هي اختباره على المحتوى الذي يحتاج الفريق فعلياً إلى إنشائه.

H3 يعتمد بنية تقنية جديدة متعددة الوسائط

تصف تقارير AIBase ومواد إصدار MiniMax العديد من التقنيات الكامنة وراء H3:

  • التمثيل الشامل السياقي (Contextual Omni Representation)
  • H3-VAE
  • H3-Omni Transformer (محول شامل)
  • إعادة التوليد داخل السياق (In-Context Regeneration)

تركز وثائق API العامة حالياً بشكل أكبر على كيفية استخدام H3 بدلاً من نشر التفاصيل التقنية الكاملة.

لم يتم نشر الأوراق البحثية المتعلقة بهذه المكونات بعد، لذلك ينبغي اعتبار الأوصاف المعمارية التفصيلية بمثابة بيانات منتج من MiniMax، ما لم يتم تقديم تقرير تقني يوفر تفاصيل إضافية قابلة لإعادة الإنتاج.

التمثيل الشامل السياقي

يهدف هذا المكون إلى تمثيل النصوص والصور والفيديو والصوت معاً في سياق مشترك.

وظيفته هي مساعدة H3 على فهم الارتباط بين مصادر مرجعية متعددة وتعليمات اللغة الطبيعية.

H3-VAE

يوصف H3-VAE بأنه جزء من حزمة تمثيل الفيديو والتوليد في النموذج.

عادةً ما تقوم أجهزة التشفير وفك التشفير للفيديو (Video VAE) بضغط معلومات الفيديو عالية الأبعاد إلى تمثيل كامن أكثر قابلية للإدارة، يُستخدم للتوليد وفك التشفير.

في الوثائق التي تمت مراجعتها وقت كتابة هذا التقرير، لم تنشر MiniMax تفاصيل تقنية عامة كافية لوصف التصميم الدقيق لـ H3-VAE بشكل مستقل.

H3-Omni Transformer

يتم تقديم H3-Omni Transformer كمكون النموذج المسؤول عن التوليد متعدد الوسائط الموحد.

يعكس اسمه الهدف الأوسع للنموذج: نظام واحد يجب أن يكون قادراً على معالجة الاستدلال عبر أنواع وسائط متعددة، بدلاً من التنقل بين نماذج خبراء مستقلة مختلفة.

إعادة التوليد داخل السياق

تدرج MiniMax أيضاً إعادة التوليد داخل السياق كجزء من حزمة تقنيات H3.

دورها المتوقع هو استخدام المعلومات الموجودة بالفعل في السياق متعدد الوسائط لتحسين جودة التوليد.

بخلاف أسماء البنى الأخرى، لم تُقدَّم تفاصيل عملية التدريب ونتائج التجارب الإلغائية في وثائق واجهة برمجة التطبيقات العامة عند الإصدار.

تسعير H3 يعتمد على مدة الفيديو

أبرز مقال AIBase فعالية H3 من حيث التكلفة.

يوفر التسعير الرسمي الحالي حسب الاستخدام من MiniMax أرقامًا مرجعية أوضح.

الدقة السعر الرسمي لواجهة برمجة التطبيقات
2K 0.13 دولار لكل ثانية مولّدة
768P 0.09 دولار لكل ثانية مولّدة

المواد المرجعية المُدخلة لها قواعد فوترة منفصلة.

تدرج MiniMax حاليًا:

  • مرجع صوتي: مجاني
  • أول 5 صور مرجعية: مجانية
  • صور مرجعية إضافية: 0.04 دولار لكل صورة
  • مرجع فيديو: يُحتسب بناءً على مدة الفيديو المُدخل ودقة الإخراج المستهدفة

صرّحت MiniMax أنه على أساس كل ثانية، تبلغ تكلفة H3 بدقة 2K أقل من ثلث تكلفة نماذج المنافسين الرئيسيين، وأقل من نصف سعر بدائل 720P الرئيسية بدقة 768P.

هذه المقارنات النسبية هي ادعاءات من الشركة المصنعة، لأن النتائج تعتمد إلى حد كبير على النماذج المنافسة المُدرجة والباقات والدقة وطرق الفوترة.

عند تخطيط الميزانية، يجب على المطورين أولًا الاعتماد على أسعار H3 المنشورة رسميًا، ثم إجراء مقارنة دقيقة مع البدائل التي يستخدمونها فعليًا.

لماذا تُعد تكلفة كل ثانية مهمة لأفكار فيديو الذكاء الاصطناعي

تزداد تكلفة توليد الفيديو خطيًا مع مدة الإخراج، لذا قد تصبح الرسوم باهظة بسرعة.

هذا يغيّر اقتصاديات التجربة والخطأ التكراري.

نادرًا ما ينتج المبدعون مقطعًا مثاليًا من المحاولة الأولى.

قد تتضمن عملية الإنتاج الكاملة:

  1. تجارب متعددة على الأوامر النصية
  2. محاولات متعددة لثبات الشخصية
  3. تغييرات في حركة الكاميرا
  4. نسب أبعاد مختلفة
  5. تصحيحات للعلامة التجارية أو المنتج
  6. توليد نهائي بدقة عالية

حتى التخفيض الطفيف في تكلفة كل ثانية يولّد وفورات تراكمية كبيرة عندما تنشئ الفرق عشرات أو مئات النسخ البديلة.

هذا مهم بشكل خاص في السيناريوهات التالية:

في مجال الإعلان والتجارة الإلكترونية، قد تتطلب الحملة التسويقية:

  • منتجات متعددة
  • أسواق متعددة
  • لغات مختلفة
  • صيغ أفقية وعمودية
  • تنويعات إبداعية متعددة

لذلك، لا يقتصر تحديد أسعار H3 على تكلفة الفيديو النهائي الواحد فقط، بل يركز أيضًا على اقتصاديات التكرار.

التوليد المرجعي هو أحد أهم قدرات H3

تدعم واجهة برمجة تطبيقات MiniMax الحالية التوليد المرجعي باستخدام مزيج من الصور والفيديو والصوت.

يدعم ذلك سير العمل التالي:

  • الحفاظ على ثبات المنتج أو الشخصية من الصور
  • تتبع حركة الفيديو المرجعي
  • استعارة سلوك الكاميرا من مقطع فيديو آخر
  • استخدام مسار صوتي مرجعي للتحكم الزمني أو التعليق الصوتي
  • دمج أشكال متعددة من المواد المرجعية في طلب واحد

صرّحت MiniMax أن H3 يمكنه الحفاظ على خصائص المرجع أو المواد المرجعية عبر مخرجات التوليد بأكملها.

هذا مهم بشكل خاص للأعمال التجارية.

يمكن للأوامر النصية العامة توليد مقاطع فيديو جذابة بصريًا، لكنها قد تغيّر:

  • الشعارات
  • نسب المنتج
  • الملابس
  • هوية الشخصية
  • التغليف
  • ألوان العلامة التجارية

توفر سير العمل القائمة على المرجع تحكمًا أكبر في هذه المتغيرات.

لكن هذا لا يضمن حفظًا مثاليًا للهوية، لذا يجب على الفرق مراجعة كل مادة مولّدة قبل نشرها.

التحكم في الإطار الأول والأخير يضيف سير عمل إنتاجي آخر

يدعم H3 أيضًا استخدام الإطار الأول أو الإطار الأخير أو كليهما معًا.

هذا مفيد عندما يعرف المبدع مسبقًا كيف يجب أن يبدأ المشهد أو ينتهي.

الاستخدامات النموذجية تشمل:

  • تحريك صورة ثابتة لمنتج
  • إنشاء انتقال بين صورتين
  • مطابقة بداية مشهد مع نهاية مشهد آخر
  • التحكم في الحالة النهائية للتحول
  • بناء تسلسلات مونتاج أكثر قابلية للتنبؤ

تتعامل واجهة برمجة تطبيقات MiniMax مع توليد الإطار الأول/الأخير والتوليد المرجعي كوضعين منفصلين.

لا يمكن للطلب الواحد خلط أدوار first_frame أو last_frame مع أدوار reference_image أو reference_video أو reference_audio في نفس المهمة.

هذا القيد مهم جدًا للمطورين الذين يدمجون هذه الواجهة.

تخطط MiniMax لإصدار أوزان نموذج H3

من أبرز أجزاء هذا الإعلان أن MiniMax تخطط لنشر أوزان H3 علنًا.

صرّحت الشركة أن الأوزان ستُطرح خلال الأيام القادمة، مع الالتزام بالقوانين واللوائح المعمول بها.

ترى MiniMax أن نشر الأوزان يساعد في:

  • توسيع نظام النماذج المفتوحة
  • دعم الإصدارات المخصصة
  • تسريع التكيف مع الأجهزة المختلفة
  • تقليل الاعتماد على خدمة استضافة واحدة
  • تشجيع التجارب البحثية والنشر

كما صرّحت الشركة أن H3 صُمم مع مراعاة التوافق مع الأجهزة منذ البداية، بما في ذلك توافق أوسع مع أجهزة الذكاء الاصطناعي.

في وقت كتابة هذا المقال، كانت صفحتا GitHub وHugging Face الرسميتان لـ MiniMax متاحتين للجمهور، لكن لم يتم ربط مستودع مؤكد لأوزان H3 العامة في وثائق واجهة برمجة التطبيقات الرسمية قيد المراجعة.

هذا يعني أن المطورين يجب أن ينتظروا الروابط الرسمية من MiniMax بدلاً من تنزيل الأوزان من مصادر غير مصرح بها.

تصحيح ادعاء "أول نموذج فيديو صيني مفتوح الأوزان"

قال مقال AIBase إن خطة إصدار H3 هي المرة الأولى التي يفتح فيها نموذج أساسي صيني لتوليد الفيديو أوزانه للمجتمع.

بشكل عام، هذا الادعاء غير دقيق تاريخيًا.

أصدرت阿里巴巴 في فبراير 2025 أوزان وكود استدلال نموذج توليد الفيديو Wan2.1، كما نُشرت إصدارات لاحقة من Wan2.1 علنًا.

نقطة التمايز الأكثر قوة لـ H3 هي هندسته المعمارية الموحدة متعددة الوسائط العامة، بما في ذلك النصوص والصور والفيديو والصوت كمراجع، والإخراج الأصلي للصوت والفيديو — وليس كونه أول نموذج فيديو صيني مفتوح الأوزان.

الأوزان المفتوحة تسهل التكيف مع الأجهزة

الأوزان المفتوحة حاسمة في الأسواق التي تريد المؤسسات فيها مزيدًا من التحكم في البنية التحتية.

واجهات برمجة التطبيقات المستضافة أسهل في البدء، لكن الأوزان المفتوحة تتيح:

  • النشر على بنية تحتية خاصة
  • تحسين النواة للأجهزة المحلية
  • قياس النموذج
  • بناء بيئات تشغيل استدلال مخصصة
  • ضبط أو تكييف المكونات ضمن حدود الترخيص
  • التكامل مع مسرعات محلية
  • إبقاء البيانات الحساسة في بيئات خاضعة للتحكم

يعتمد مدى قدرة H3 على الاستضافة الذاتية على معلومات غير متاحة علنًا في المقالة المصدر، بما في ذلك:

  • عدد المعاملات
  • متطلبات الذاكرة
  • دقة الاستدلال
  • متطلبات التوازي
  • الحد الأدنى من تكوين الأجهزة
  • شروط الترخيص
  • دعم التدريب أو الضبط الدقيق

قبل نشر الأوزان والوثائق التقنية الرسمية، فإن الادعاءات حول توافق وحدات معالجة الرسوميات الاستهلاكية أو تكاليف الاستضافة الذاتية هي مجرد تخمين.

Mإنيماكس تعترف بأن H3 لا يزال أمامه مجال للتحسين

صرّحت MiniMax أيضًا أن النموذج ليس النهاية النهائية لسلسلة H.

أشارت الشركة إلى المجالات التالية:

  • التفاصيل الدقيقة للصور
  • الحجم الكلي للنموذج
  • توسع القدرات مستقبلًا

صرّحت MiniMax أنها تخطط لمواصلة توسيع نماذج سلسلة H ودمج قدرات عائلتي H وM في النهاية.

تركز عائلة H حاليًا على التوليد متعدد الوسائط، خاصة الفيديو.

تشمل عائلة M نماذج اللغة والوكلاء الذكيون من MiniMax.

قد يشير الدمج المستقبلي إلى نظام يمكن لعائلة نماذج واحدة أن تتعامل مع:

  • الاستدلال اللغوي
  • تنفيذ الوكلاء
  • فهم الصور
  • فهم الفيديو
  • الصوت
  • إنشاء الفيديو
  • التحرير

لا يزال هذا اتجاهًا مستقبليًا وليس منتجًا موحدًا مُطلقًا حاليًا.

تغيير H3 لسير عمل توليد الفيديو

أهم مساهمة لـ H3 ليست فقط دقة أعلى.

التحول الأكبر هو أن عمليات الإبداع المتعددة التي كانت مستقلة سابقًا يمكن الآن تنفيذها في سياق واحد.

يمكن للمبدعين الانتقال من:

أنشئ فيديو بناءً على هذه الجملة.

إلى:

استخدم هذا الشخص، واتبع الحركات في هذا الفيديو، وحافظ على هذه الهوية البصرية،
وخذ إشارات الإيقاع من هذا الصوت، وأنشئ مشهدًا جديدًا بناءً على هذا الأمر النصي.

هذا يغيّر دور نموذج الفيديو.

لم يعد مجرد مولّد أحادي الغرض، بل أصبح محركًا إبداعيًا متعدد الوسائط.

للفرق التجارية، تعتمد القيمة على مدى قدرة H3 على الحفاظ على اتساق المرجع، واتباع الأوامر المعقدة، وعرض معلومات العلامة التجارية، والبقاء فعالًا من حيث التكلفة.

عبر أجيال.

الأسئلة الشائعة

ما هو MiniMax H3؟

MiniMax H3 هو نموذج توليد فيديو متعدد الوسائط عام من MiniMax. يقبل النصوص والصور والفيديو والصوت كسياق، ويدعم توليد فيديو من نص، وتوليد فيديو من صورة، والتوليد القائم على مواد مرجعية، وإنشاء فيديو موجه.

ما الدقة التي يدعمها MiniMax H3؟

تدرج وثائق واجهة برمجة تطبيقات MiniMax الحالية 2K كدقة الإخراج الرئيسية لـ H3. كما تدرج صفحة التسعير فئة فوترة بدقة 768P.

ما أقصى مدة فيديو يمكن أن يولّدها MiniMax H3؟

تدعم وثائق H3 الرسمية إخراج فيديو يصل إلى 15 ثانية. تقبل مرجع واجهة برمجة التطبيقات حاليًا قيمًا صحيحة للمدة بين 4 و15 ثانية.

هل يولد MiniMax H3 الصوت؟

نعم. تصف MiniMax تقنية H3 بأنها تدعم الإخراج الفيديو الصوتي المجسم الأصلي، وبالتالي يمكن توليد الصوت كجزء من سير عمل الفيديو دون الاعتماد دائمًا على نماذج ما بعد الإنتاج المنفصلة.

ما هي تكلفة استخدام واجهة برمجة تطبيقات MiniMax H3؟

تسعّر MiniMax حاليًا تقنية H3 بمبلغ 0.13 دولارًا لكل ثانية من التوليد بدقة 2K، و0.09 دولارًا لكل ثانية بدقة 768P. وفقًا لقواعد الفوترة المنشورة، قد تؤدي الفيديوهات المرجعية والصور الإضافية إلى زيادة تكاليف مواد الإدخال.

هل يمكن لتقنية H3 استخدام الصور والفيديوهات والصوت المرجعية في نفس الوقت؟

نعم. تدعم واجهة برمجة التطبيقات الرسمية الصور والفيديوهات والصوت المرجعية في نفس سير عمل التوليد المرجعي، مع الالتزام بقيود عدد الملفات والمدة والحجم وتوليفات الإدخال.

هل تقنية MiniMax H3 مفتوحة المصدر؟

أعلنت MiniMax عن خطط لإصدار أوزان نموذج H3 خلال الأيام القادمة، مع الالتزام باللوائح المعمول بها. في وقت كتابة هذا المقال، كانت واجهة برمجة التطبيقات الرسمية متاحة بالفعل، ولكن لم يتم تأكيد رابط لمستودع أوزان H3 العام في الوثائق الرسمية التي تم الاطلاع عليها في هذه المراجعة.

هل H3 هو أول نموذج فيديو صيني بأوزان مفتوحة المصدر؟

لا، ليس من الناحية التاريخية الواسعة. أصدرت شركة علي بابا أوزان نموذج توليد الفيديو Wan2.1 في عام 2025. ما يميز H3 أكثر هو دمجه لقدرات المرجع متعدد الوسائط والتوليد الصوتي المرئي الأصلي في نموذج فيديو عام واحد.

أدوات ذات صلة

  • واجهة برمجة تطبيقات MiniMax H3: الوثائق الرسمية لسير عمل النص إلى فيديو والصورة إلى فيديو والتوليد المرجعي لتقنية H3.
  • منصة MiniMax المفتوحة: منصة مطوري MiniMax، توفر مفاتيح API والوصول إلى النماذج والفوترة وموارد المطورين.
  • MiniMax على GitHub: المنظمة الرسمية للشركة على GitHub للمشاريع المتعلقة بالكود والنماذج العامة.
  • MiniMax على Hugging Face: المنظمة الرسمية لـ MiniMax على Hugging Face لموارد النماذج العامة.
  • Wan2.1: سلسلة نماذج توليد الفيديو مفتوحة المصدر من علي بابا، يمكن استخدامها كمرجع تاريخي لنماذج الفيديو بأوزان مفتوحة المصدر.

روابط ذات صلة

الخلاصة

يجمع MiniMax H3 بين النصوص والصور والفيديوهات والصوت في سير عمل واحد عام لتوليد الفيديو. يدعم إخراجًا بدقة 2K يصل إلى 15 ثانية، وصوتًا مجسمًا أصليًا، وتحكمًا في الإطار الأول/الأخير، والتوليد المرجعي باستخدام أنواع متعددة من الوسائط.

تتركز مزاياها التجارية في جانبين: القدرة على التحكم والتكلفة. تقول MiniMax إن H3 يؤدي بشكل جيد في اتباع التعليمات وعرض العلامة التجارية ونقل الحركة، بينما تسعّر واجهة برمجة التطبيقات الرسمية حاليًا التوليد بدقة 2K بمبلغ 0.13 دولارًا لكل ثانية وبدقة 768P بمبلغ 0.09 دولارًا لكل ثانية.

تخطط MiniMax أيضًا لإصدار أوزان النموذج، على الرغم من أنه في الوثائق الرسمية التي تمت مراجعتها وقت الإصدار، لم يتم ربط مستودع أوزان H3 المؤكد بعد.

أهم تحول في H3 ليس فقط فيديو 2K — بل التوجه نحو نظام توليد متعدد الوسائط موحد قادر على فهم كيفية عمل النصوص والصور والفيديوهات والصوت معًا.