به گزارش آی سی تی نیوز؛  شرکت‌های چینی در اقدامی هم‌زمان، دو مدل هوش مصنوعی متن‌باز جدید را منتشر کردند که هر کدام در حوزه خود، مدل‌های بسته غربی را به چالش می‌کشند. علی‌بابا مدل تصویرساز Qwen-Image-2.1 را با ۷ میلیارد پارامتر عرضه کرده و شیائومی مدل چندوجهی MiMo-V2.6-Pro را با یک تریلیون پارامتر کل و قیمتی بسیار پایین‌تر از رقبا منتشر کرده است.

Qwen-Image-2.1؛ مدل تصویرساز ۷ میلیاردی علی‌بابا

علی‌بابا در تاریخ ۲۰ سپتامبر ۲۰۲۶ (۲۹ شهریور ۱۴۰۵) مدل Qwen-Image-2.1 را با معماری ۷ میلیارد پارامتری و وزن‌های متن‌باز منتشر کرد. این مدل از کدگذار متن Qwen3-VL 8B و VAE با ۶۴ کانال RGBA بهره می‌برد و قابلیت تولید تصاویر با لایه‌های شفاف را به‌صورت بومی دارد؛ به این معنا که کاربران بدون نیاز به حذف پس‌زمینه، می‌توانند تصاویری با پس‌زمینه شفاف تولید کنند.

Qwen-Image-2.1 می‌تواند حداکثر ۱۰ تصویر مرجع دریافت کند و قابلیت‌هایی مانند ویرایش متن درون تصویر، ترکیب تصاویر، استخراج سوژه از عکس واقعی و تولید پانوراما و اینفوگرافیک را ارائه می‌دهد. در بنچمارک Qwen-Image-Bench، این مدل امتیاز ۶۰.۲۸ را کسب کرده که بالاتر از Nano Banana 2.0 با ۵۹.۸۲ و GPT Image 1.5 با ۵۹.۶۵ قرار می‌گیرد.

نکته مهم درباره Qwen-Image-2.1 این است که برخلاف نسخه‌های قبلی که با مجوز Apache 2.0 منتشر می‌شدند، این مدل تحت مجوز Qwen Research License و صرفاً برای مصارف غیرتجاری و پژوهشی عرضه شده است. استفاده تجاری از آن نیازمند مجوز جداگانه از علی‌بابا است. با این حال، در روز انتشار، از سوی ComfyUI، Diffusers، vLLM-Omni و SGLang پشتیبانی شد.

MiMo-V2.6-Pro؛ مدل یک تریلیون پارامتری شیائومی با قیمت ۲۰ برابر کمتر

شیائومی نیز در تاریخ ۲۱ سپتامبر ۲۰۲۶ (۳۰ شهریور ۱۴۰۵) مدل متن‌باز MiMo-V2.6-Pro را منتشر کرد. این مدل یک MoE با ۱.۰۲ تریلیون پارامتر کل و ۴۲ میلیارد پارامتر فعال در هر توکن است که از ورودی متن، تصویر، صدا و ویدیو پشتیبانی می‌کند و پنجره کانتکست آن به ۱ میلیون توکن می‌رسد.

بر اساس داده‌های منتشرشده، امتیاز MiMo-V2.6-Pro در شاخص هوش Artificial Analysis حدود ۴۶ است که بالاترین امتیاز در میان مدل‌های متن‌باز محسوب می‌شود و از Kimi K3 و Qwen3.8 Max نیز پیشی گرفته است. این مدل در بنچمارک Terminal Bench 2.1 امتیاز ۸۹.۹ کسب کرده که بالاتر از Claude Opus 5 قرار می‌گیرد.

مهم‌ترین مزیت MiMo-V2.6-Pro، قیمت بسیار پایین آن است. هزینه هر میلیون توکن ورودی این مدل ۰.۴۳۵ دلار و خروجی ۰.۸۷ دلار اعلام شده که در مقایسه با رقبای مطرح، حدود ۹ برابر ارزان‌تر در ورودی و ۲۳ برابر ارزان‌تر در خروجی است. در مقایسه با Claude Opus 5، این قیمت نزدیک به ۲۰ برابر کمتر برآورد می‌شود. نسخه ارزان‌تر این مدل با نام Flash نیز با قیمت ۰.۱۴ دلار ورودی و ۰.۲۸ دلار خروجی در دسترس است.

شیائومی هزینه آموزش این مدل را حدود ۲.۶۲ میلیون دلار در کمتر از ۶ روز اعلام کرده و کد آموزش RL و حدود ۷,۰۰۰ محیط وظیفه را نیز متن‌باز کرده است. وزن‌های این مدل با مجوز MIT و اجازه استفاده تجاری روی Hugging Face در دسترس قرار دارد.

تفاوت رویکرد دو شرکت

نکته قابل توجه در این دو انتشار، تفاوت رویکرد علی‌بابا و شیائومی در مجوزدهی است. علی‌بابا Qwen-Image-2.1 را با مجوز پژوهش‌محور منتشر کرده و استفاده تجاری از آن را محدود کرده است، در حالی که شیائومی MiMo-V2.6-Pro را با مجوز MIT و اجازه استفاده تجاری آزاد عرضه کرده است.

همچنین این دو مدل در حوزه‌های متفاوتی فعالیت می‌کنند. Qwen-Image-2.1 یک مدل تصویرساز است، در حالی که MiMo-V2.6-Pro یک مدل زبانی چندوجهی محسوب می‌شود.

تحلیل ICTNews

انتشار هم‌زمان این دو مدل متن‌باز از سوی علی‌بابا و شیائومی، نشان‌دهنده یک تغییر استراتژیک در صنعت هوش مصنوعی چین است. شرکت‌های چینی به‌جای رقابت صرف بر سر قدرت مدل‌ها، اکنون بر باز بودن، کارایی هزینه و دسترسی‌پذیری تمرکز کرده‌اند.

MiMo-V2.6-Pro با قیمت ۲۰ برابر کمتر از Claude Opus 5 و عملکردی هم‌سطح GPT-5.6-Sol، می‌تواند معادلات بازار API را به‌طور جدی تغییر دهد. اگر این مدل بتواند وعده‌های عملکردی خود را در عمل نیز محقق کند، بسیاری از استارتاپ‌ها و توسعه‌دهندگان ممکن است به سمت آن جذب شوند.

در سمت تصویر، Qwen-Image-2.1 با قابلیت خروجی RGBA و پشتی بانی از ۱۰ تصویر مرجع، ابزاری قدرتمند برای طراحان و تولیدکنندگان محتوا محسوب می‌شود. محدودیت مجوز پژوهش‌محور، هرچند استفاده تجاری را محدود می‌کند، اما نشان می‌دهد علی‌بابا هنوز در حال ارزیابی پتانسیل تجاری این مدل است.

در مجموع، به نظر می‌رسد چین با استراتژی «متن‌باز و ارزان»، در حال ایجاد یک جبهه جدید در رقابت جهانی هوش مصنوعی است؛ جبهه‌ای که در آن، قیمت و دسترسی‌پذیری به‌اندازه قدرت خام مدل‌ها اهمیت دارد.