GPT-6 Astra در برابر رقبا؛ بررسی بنچمارک‌ها و نقاط قوت مدل جدید OpenAI
فناوری اطلاعات 07 September 2026 7 دقیقه مطالعه

GPT-6 Astra در برابر رقبا؛ بررسی بنچمارک‌ها و نقاط قوت مدل جدید OpenAI

میثاق  نعمت وند

میثاق نعمت وند

parsaparasteh@gmail.com

معرفی GPT-6 Astra موج تازه‌ای از بحث درباره آینده مدل‌های هوش مصنوعی را به راه انداخته است. نتایج اولیه، مخصوصاً امتیاز ۹۹.۹ درصدی در ARC-AGI-3، بسیار چشمگیر به نظر می‌رسند؛ اما وقتی مجموعه بزرگ‌تری از آزمون‌ها را کنار هم قرار دهیم، تصویر متعادل‌تری به دست می‌آید. Astra در بعضی وظایف تخصصی جهش بزرگی دارد، درحالی‌که در برخی ارزیابی‌های عمومی هنوز رقبایی مانند Claude Fable 5.1 عملکرد بهتری دارند.

آیا امتیاز ۹۹.۹ درصدی به معنی AGI است؟

بیشترین توجه در زمان معرفی Astra به ARC-AGI-3 اختصاص پیدا کرد؛ جایی که مدل در اجرای آزمایش اختصاصی OpenAI به امتیاز ۹۹.۹ درصد رسید. بااین‌حال، یک ارزیابی مستقل و استانداردشده عدد ۶۲.۷ درصد را ثبت کرده است. این تفاوت نشان می‌دهد روش اجرای آزمون و ابزارهای در اختیار مدل می‌توانند نتیجه را به شکل قابل‌توجهی تغییر دهند. بنابراین یک امتیاز بسیار بالا در یک بنچمارک، به‌تنهایی اثبات نمی‌کند که Astra به هوش جامع مصنوعی یا AGI رسیده است.

عملکرد قوی Astra در کدنویسی

در کارهای برنامه‌نویسی، Astra یکی از نقاط قوت خود را نشان می‌دهد. در Terminal-Bench 4.0 امتیاز ۵۷.۹ درصدی آن بالاتر از GPT-5.6 Sol با ۳۷.۳ درصد و Claude Fable 5.1 با ۵۵.۸ درصد قرار گرفته است. در DeepSWE نیز Astra به ۷۴.۱ درصد رسیده و فاصله آن با چند رقیب بسیار کم است. این نتایج نشان می‌دهند Astra برای وظایفی مثل کار با ترمینال، مهندسی نرم‌افزار و حل مسائل چندمرحله‌ای انتخاب قدرتمندی است، هرچند نمی‌توان آن را در تمام سناریوهای کدنویسی برنده مطلق دانست.

در FrontierCode 1.1 Extended، Astra با امتیاز ۶۴.۵ درصد کمی پایین‌تر از Claude Fable 5 با ۶۴.۹ درصد قرار می‌گیرد، اما از GPT-5.6 Sol با ۶۰.۶ درصد بهتر است. در شاخص Coding Agent نیز Astra امتیاز ۶۷ را به دست آورده، درحالی‌که Fable 5.1 به ۷۰ رسیده است. نکته مهم این است که Astra برای رسیدن به این نتایج در برخی آزمون‌ها توکن‌های کمتری مصرف می‌کند و همین موضوع می‌تواند هزینه واقعی انجام یک وظیفه را کاهش دهد.

جایی که Astra واقعاً می‌درخشد: کار با کامپیوتر

یکی از مهم‌ترین تفاوت‌های Astra با مدل‌های سنتی‌تر، توانایی آن در انجام کارهای ایجنت‌محور است. در OSWorld 2.0، که توانایی مدل برای کنترل محیط دسکتاپ و انجام وظایف واقعی را می‌سنجد، Astra به امتیاز ۷۲.۶ درصد رسیده است؛ بالاتر از GPT-5.6 Sol با ۶۵.۷ درصد. این مدل همچنین در شبیه‌سازی‌های آزمون با زمان کمتری برای تکمیل هر وظیفه به نتیجه رسیده است.

در ScreenSpot-Pro نیز Astra با امتیاز ۹۲.۷ درصد فاصله محسوسی با Sol دارد که ۷۶.۹ درصد ثبت کرده است. چنین نتیجه‌ای اهمیت زیادی دارد، چون مدل را برای تشخیص عناصر رابط کاربری و تعامل دقیق با محیط‌های نرم‌افزاری آماده‌تر می‌کند. در AutomationBench نیز Astra با ۴۱.۴ درصد بالاتر از Sol با ۱۸.۱ درصد و Fable 5.1 با ۳۱.۴ درصد قرار گرفته است.

در استدلال عمومی هنوز رقیبان جدی هستند

وقتی عملکرد کلی مدل‌ها را با شاخص Artificial Analysis Intelligence مقایسه کنیم، برتری Astra دیگر قطعی نیست. این مدل در نسخه ۴.۱.۱ امتیاز ۶۱.۲ گرفته، درحالی‌که GPT-5.6 Sol امتیاز ۶۰.۹ و Claude Fable 5.1 امتیاز ۶۵.۷ داشته‌اند. بنابراین Astra بیشتر شبیه مدلی است که برای انجام وظایف پیچیده و چندمرحله‌ای بهینه شده، نه مدلی که در تمام انواع استدلال به شکل یکسان از رقبا جلو باشد.

ریاضیات و جست‌وجوی اطلاعات؛ نتایج بسیار قوی

در BrowseComp، Astra به امتیاز ۹۱.۵ درصد رسیده و اندکی از Sol بهتر است. در GPQA Diamond نیز امتیاز ۹۶ درصدی آن بالاتر از Sol با ۹۴.۶ درصد قرار دارد. در FrontierMath Tier 4 نسخه دوم، نتیجه Astra به ۹۷.۶ درصد می‌رسد که فاصله زیادی با ۸۳ درصد Sol دارد. بااین‌حال، امتیاز بالای یک بنچمارک ریاضی را نباید معادل توانایی حل همه مسائل دشوار دنیای واقعی دانست.

در امنیت سایبری، جهش Astra چشمگیر است

بخش امنیت سایبری یکی دیگر از حوزه‌هایی است که نتایج Astra توجه زیادی جلب کرده‌اند. در ExploitBench، این مدل به امتیاز ۱۰۰ درصد رسیده، درحالی‌که GPT-5.6 Sol امتیاز ۷۸.۵ درصد داشته است. Astra در ExploitGym نیز ۴۲.۴ درصد گرفته و در ارزیابی SRE-Bench توانسته در نخستین تلاش ۸۸ درصد وظایف را حل کند و با چهار تلاش به ۹۹.۲ درصد برسد. این قابلیت‌ها نشان می‌دهند مدل جدید در تحلیل مشکلات پیچیده نرم‌افزاری و امنیتی قدرت بالایی دارد.

قیمت بالاتر، اما مصرف توکن کمتر

قیمت رسمی Astra برای هر یک میلیون توکن ورودی ۱۰ دلار و برای هر یک میلیون توکن خروجی ۵۰ دلار اعلام شده است؛ یعنی نرخ اسمی آن حدود ۲.۵ برابر GPT-5.6 Sol است. بااین‌حال، مقایسه صرف قیمت توکن تصویر کاملی ارائه نمی‌دهد. Astra در برخی وظایف ایجنتی با مصرف توکن بسیار کمتر می‌تواند همان کار را انجام دهد و در نتیجه هزینه نهایی یک وظیفه پیچیده ممکن است به اندازه اختلاف قیمت هر توکن افزایش پیدا نکند.

آیا GPT-6 Astra از Claude Fable 5.1 بهتر است؟

پاسخ به این سؤال به نوع استفاده بستگی دارد. Astra در کار با کامپیوتر، اجرای وظایف طولانی، ترمینال، برخی آزمون‌های ریاضی و امنیت سایبری عملکرد بسیار قدرتمندی دارد. از طرف دیگر، Fable 5.1 در شاخص‌های عمومی‌تر مانند Artificial Analysis Intelligence و Humanity's Last Exam در برخی نتایج بالاتر قرار گرفته است. بنابراین فعلاً منطقی‌تر است Astra را یک مدل بسیار قدرتمند و تخصصی برای گردش‌کارهای ایجنتی بدانیم، نه مدلی که در همه زمینه‌ها بدون رقیب باشد.

جمع‌بندی

بنچمارک‌های GPT-6 Astra نشان می‌دهند OpenAI تمرکز جدی روی مدل‌هایی گذاشته است که بتوانند به‌جای پاسخ‌دادن صرف، با کامپیوتر کار کنند، ابزارها را به کار بگیرند و وظایف چندمرحله‌ای را تا رسیدن به نتیجه ادامه دهند. امتیازهای بسیار بالا در بعضی آزمون‌ها واقعاً چشمگیرند، اما اختلاف نتایج بین بنچمارک‌ها نشان می‌دهد هنوز نمی‌توان یک مدل را در تمام ابعاد بهترین دانست. برای کاربرانی که به اتوماسیون، برنامه‌نویسی و اجرای گردش‌کارهای پیچیده نیاز دارند، Astra می‌تواند یکی از مهم‌ترین مدل‌های نسل جدید باشد.

این مقاله را با دوستان خود به اشتراک بگذارید

میثاق  نعمت وند

میثاق نعمت وند

parsaparasteh@gmail.com

نظرات کاربران (0)

هنوز نظری ثبت نشده است. اولین نفر باشید!

شماره تماس: 02128427232
آدرس ایمیل: sales@rayanshopping.com
از شنبه تا پنج‌شنبه ساعت ۱۰ صبح تا ۹ شب و جمعه ساعت ۱۰ صبح تا ۲ ظهر پاسخگوی شما هستیم

رسانه‌های خبری ما

عضویت در خبرنامه

مجموعه رایان با بیش از یک دهه تجربه، فعالیت خود را از سال ۱۳۹۰ در زمینه فروش تلفن همراه و لوازم جانبی برند شیائومی آغاز کرد. این مجموعه با تکیه بر اصول مشتری‌مداری، کیفیت محصولات و خدمات پس از فروش، توانست در سال ۱۳۹۸ به‌عنوان اولین نمایندگی انحصاری برند کلومن در شهر اردبیل فعالیت خود را گسترش دهد.

استفاده از مطالب فروشگاه اینترنتی رایان فقط برای مقاصد غیرتجاری و با ذکر منبع بلامانع است. 1398-1405 کلیه حقوق این سایت متعلق به مجموعه رایان می‌باشد.

طراحی و توسعه توسط