شرکت SpaceXAI از جدیدترین مدل هوش مصنوعی پرچمدار خود با نام Grok 4.6 رونمایی کرده است؛ مدلی که بیش از افزایش صرف قدرت استدلال، برای انجام وظایف طولانی و چندمرحلهای طراحی شده است. SpaceXAI این مدل را رقیبی مستقیم برای مدلهای ردهبالای OpenAI و Anthropic میداند و روی توانایی آن در برنامهنویسی، پژوهش، توسعه نرمافزار و اجرای وظایف عاملمحور تأکید دارد.
خلاصه خبر در یک نگاه
شرکت SpaceXAI مدل هوش مصنوعی پرچمدار Grok 4.6 را برای وظایف طولانی و چندمرحلهای معرفی کرد.
این مدل در برخی بنچمارکها با مدلهای ردهبالای OpenAI و Anthropic رقابت میکند.
گروک 4.6 در تمام بنچمارکهای اعلامشده نسبت به Grok 4.5 High عملکرد بهتری دارد.
مدل جدید در برخی ارزیابیها اول شده و در برخی دیگر از رقبا عقب مانده است.
قیمت Grok 4.6 برابر با ۲ دلار برای هر یک میلیون توکن ورودی و ۶ دلار برای خروجی است.
این مدل از طریق Cursor ،Grok Build ،API و سرویسهایی مانند OpenRouter ،Vercel و Cloudflare در دسترس است.
مدل هوش مصنوعی Grok 4.6 برای انجام وظایف طولانی طراحی شده است
در حالی که رقابت میان شرکتهای فعال در حوزه هوش مصنوعی بیشتر به سمت مدلهایی با قابلیت اجرای وظایف پیچیده و طولانی حرکت کرده، SpaceXAI نیز با Grok 4.6 روی همین حوزه تمرکز کرده است.
این مدل برای اجرای وظایف چندمرحلهای طراحی شده؛ از جمله جلسات طولانی برنامهنویسی، پژوهشهای چندمرحلهای و ساخت اپلیکیشن از ایده اولیه تا محصول نهایی.
شرکت SpaceXAI میگوید Grok 4.6 میتواند در جریان اجرای وظایف عاملمحور (Agentic) برای مدت طولانیتری روی هدف اصلی متمرکز بماند. این مدل همچنین در کارهای طولانیتر رفتارهای خودارزیابانه بیشتری نشان میدهد و پیش از ادامه کار، خروجیهای خود را بررسی میکند.
مدل هوش مصنوعی Grok 4.6
تغییرات فنی Grok 4.6
اسپیسایکسایآی همچنین میگوید Grok 4.6 نسبت به نسل قبلی وارد یک مرحله آموزشی ثانویه طولانیتر شده است. در این مرحله از دادههای انتخابشده و تولیدشده توسط مدل برای بهبود استدلال و عمق فنی، مجموعهدادههای مهندسی و تغییراتی در بهینهساز و فرایند آموزش استفاده شده است.
برای مرحله Supervised Fine-Tuning، شرکت SpaceXAI از Grok 4.5 برای بازتولید مسیرهای آموزشی در سطوح مختلف تلاش استدلالی، محیطهای عاملمحور و حوزههایی مانند علوم، فناوری، مهندسی و ریاضیات، مهندسی نرمافزار و کارهای عمومی دانشمحور استفاده کرده است.
در مرحله Reinforcement Learning نیز Grok 4.6 با طیف گستردهای از وظایف عاملمحور آموزش دیده است؛ از برنامهنویسی و کارهای دانشمحور گرفته تا بهینهسازی کرنل، توسعه وب و طراحی به کمک کامپیوتر یا CAD.
اسپیسایکسایآی همچنین ادعا میکند Grok 4.6 در پروژههای بصری و تعاملی، نخستین خروجیهای بهتری نسبت به Grok 4.5 ارائه میکند و در بسیاری از موارد میتواند ساختار و زبان طراحی یک اپلیکیشن را از همان تلاش اول به شکل قابل قبول ایجاد کند.
عملکرد Grok 4.6 در بنچمارکها
اسپیسایکسایآی، مدل جدید خود را با GPT-5.6 Sol از OpenAI و Claude Fable 5 از Anthropic در مجموعهای از آزمونهای برنامهنویسی و وظایف عاملمحور مقایسه کرده است.
نتایج اعلامشده نشان میدهد Grok 4.6 در مجموع در همان سطح دو رقیب قرار دارد و نه برتری مطلقی نسبت به آنها دارد و نه فاصله زیادی با آنها نشان میدهد.
بنچمارک Grok 4.6 GPT-5.6 Sol Max Fable 5 Max Artificial Analysis Intelligence Index ۶۱ ۶۱ ۶۲ GDPVal-AA v2 ۱۷۵۳ ۱۷۲۸ ۱۷۴۱ CursorBench v3.2 ۶۹.۹٪ ۶۷.۲٪ ۷۰.۵٪ DeepSWE v1.1 ۶۵.۹٪ ۷۳٪ ۷۰٪ FrontierCode v1.1 (Extended) ۶۱.۳٪ ۶۰.۶٪ ۶۴.۹٪ APEX-Agents ۵۷.۵٪ ۵۶.۷٪ ۵۹.۲٪ Terminal-Bench v3.0 ۲۶٪ ۳۴.۶٪ ۳۴.۱٪ APEX-SWE ۵۶.۴٪ — ۵۸.۸٪ AA-Briefcase ۱۵۷۷ ۱۵۰۲ ۱۵۷۴ Harvey LAB (Vals) ۱۵.۸٪ ۲.۵٪ ۱۱.۳٪در شاخص Artificial Analysis Intelligence Index که از ترکیب ۹ بنچمارک مختلف به دست میآید، Grok 4.6 امتیاز ۶۱ را کسب کرده است؛ دقیقاً برابر با GPT-5.6 Sol Max و تنها یک امتیاز کمتر از Fable 5 Max با امتیاز ۶۲.
در مقایسه، Grok 4.5 High در همین شاخص امتیاز ۵۶ را به دست آورده بود. Grok 4.6 همچنین در تمام بنچمارکهای اعلامشده نسبت به نسل قبلی خود عملکرد بهتری داشته است.
بنچمارک مدل هوش مصنوعی Grok 4.6
مدل Grok 4.6 در کدام بنچمارکها بهتر عمل کرد؟
مدل Grok 4.6 در GDPVal-AA v2 ،AA-Briefcase و Harvey LAB بالاترین امتیاز را در مقایسه با دو رقیب اعلامشده کسب کرده است. در CursorBench نیز فاصله کمی با Fable 5 Max دارد.
در مقابل، در آزمونهایی مانند DeepSWE ،FrontierCode و Terminal-Bench از یکی یا هر دو رقیب عقبتر قرار گرفته است. ضعیفترین نتیجه نسبی Grok 4.6 در Terminal-Bench دیده میشود؛ جایی که امتیاز ۲۶ درصدی آن پایینتر از امتیاز ۳۴.۶ درصدی GPT-5.6 Sol Max و ۳۴.۱ درصدی Fable 5 Max است.
البته تمام این نتایج توسط SpaceXAI گزارش شدهاند. این شرکت میگوید اعداد مربوط به مدلهای رقیب را از System Cardهای منتشرشده یا جدولهای رتبهبندی عمومی گرفته و خودش مدلهای رقیب را اجرا نکرده است.
قیمت Grok 4.6؛ تمرکز SpaceXAI روی هزینه کمتر
یکی از مهمترین مزیتهایی که SpaceXAI برای Grok 4.6 مطرح میکند، قیمت آن است. این شرکت مدل جدید را با قیمت زیر ارائه میکند:
- توکن ورودی: ۲ دلار به ازای هر یک میلیون توکن
- توکن خروجی: ۶ دلار به ازای هر یک میلیون توکن
اسپیسایکسایآی میگوید این قیمت تقریباً نصف هزینه مدلهای پیشرفته قابل مقایسه است. یک نسخه سریعتر نیز با قیمت دو برابر در دسترس قرار دارد که برای کاربرانی طراحی شده است که تأخیر کمتر را ترجیح میدهند.
مدل Grok 4.6 از کجا در دسترس است؟
مدل Grok 4.6 از امروز در Cursor و سرویس Grok Build خود SpaceXAI در دسترس قرار گرفته است. کاربران همچنین میتوانند از طریق API و پلتفرمهای شخص ثالث زیر به این مدل دسترسی داشته باشند:
- OpenRouter
- Vercel
- Cloudflare
اسپیسایکسایآی برای تشویق کاربران به آزمایش مدل جدید، در هفته نخست پس از عرضه، میزان استفاده معمولاً درنظرگرفتهشده در Grok Build و Cursor را دو برابر کرده است.
ایمنی Grok 4.6
اسپیسایکسایآی میگوید سیستمهای ایمنی Grok 4.6 نیز متناسب با قابلیتهای گستردهتر این مدل بازتنظیم شدهاند. این شرکت اعلام کرده که مدل جدید پیش از عرضه تحت گستردهترین دور آزمایشهای ایمنی خود تا امروز قرار گرفته و ارزیابیهای پس از عرضه و بررسیهای شخص ثالث نیز ادامه خواهد داشت.
همچنین بخوانید: برند xAI رسماً به SpaceXAI تغییر کرد؛ آغاز فعالیت رسمی شرکت ادغامشده ایلان ماسک
نظر شما درباره Grok 4.6 چیست؟ آیا قیمت پایینتر برایتان اهمیت بیشتری دارد یا ترجیح میدهید همچنان از مدلهایی با عملکرد برتر در بنچمارکهای مشخص استفاده کنید؟
نوشته مدل هوش مصنوعی Grok 4.6 معرفی شد؛ مدعی رقابت با GPT-5.6 Sol و Claude Fable 5 با قیمتی ارزانتر اولین بار در ترنجی پدیدار شد.