
شرکت OpenAI با معرفی مدل GPT-6 Astra مدعی شده است که جهان به آستانه ورود به عصر هوش عمومی مصنوعی (AGI) رسیده است؛ مرحلهای فرضی از توسعه هوش مصنوعی که در آن ماشینها میتوانند مانند انسان در حوزههای مختلف یاد بگیرند، استدلال کنند و مسائل جدید را حل کنند. بااینحال، عملکرد این مدل در آزمونهای تخصصی و اختلاف میان نتایج اعلامشده و ارزیابیهای مستقل، پرسشهای مهمی درباره تحقق واقعی AGI ایجاد کرده است.
عملکرد چشمگیر GPT-6 Astra در آزمونهای هوش مصنوعی
گرگ بروکمن، رئیس OpenAI، هنگام معرفی GPT-6 Astra در ۳ سپتامبر ۲۰۲۶ اظهار کرد که ممکن است در آینده، این دوره بهعنوان زمان ظهور هوش عمومی مصنوعی شناخته شود. بر اساس اعلام OpenAI، این مدل در مهندسی نرمافزار، ریاضیات، تحقیقات علمی و استفاده خودکار از نرمافزارها عملکرد قابلتوجهی دارد. از جمله تواناییهای نمایشدادهشده آن میتوان به تولید کد برای طراحی سهبعدی، طراحی بردهای مدار چاپی، تبدیل مدلهای سهبعدی به محیطهای تعاملی شبیه بازیهای ویدئویی و راهاندازی برنامههای تحت وب با استفاده از دستورهای متنی اشاره کرد.
یکی از نتایج برجسته GPT-6 Astra مربوط به آزمون ARC-AGI-3 است؛ معیاری برای ارزیابی توانایی سیستمهای هوش مصنوعی در یادگیری مهارتهای جدید و حل مسائل انتزاعی. OpenAI برای این مدل امتیاز ۹۹.۹ درصد را اعلام کرد. همچنین، ارزیابی بنیاد ARC Prize نشان داد که مدل در ۹۶ درصد مراحل از معیار بهرهوری حرکتی انسان فراتر رفته و بهطور متوسط برای حل هر مرحله به ۵۱.۷ درصد اقدام کمتر نیاز داشته است.
چرا نتایج آزمونها به معنای اثبات AGI نیست؟
با وجود این دستاوردها، پژوهشگران درباره تفسیر نتایج تردید دارند. طبق گزارش لایو ساینس، امتیاز ۹۹.۹ درصدی GPT-6 Astra با استفاده از یک چارچوب نرمافزاری اختصاصی به نام Provider Adapter به دست آمده است؛ اما هنگامی که مدل با چارچوب استاندارد آزمون ارزیابی شد، امتیاز آن به ۶۲.۷ درصد کاهش یافت. مسئولان بنیاد ARC Prize نیز تأکید کردهاند که کسب امتیاز بالا در این آزمون، اثباتکننده دستیابی به هوش عمومی مصنوعی نیست؛ زیرا محیطهای آزمایشی محدود و قابلپیشبینی نمیتوانند تمام پیچیدگیهای دنیای واقعی را بازتاب دهند.

نگرانی دیگر به تغییر برخی ارقام منتشرشده مربوط میشود. دو پژوهشگر دانشگاه استنفورد به اصلاح چند معیار پس از عرضه مدل اشاره کردهاند. این موضوع بحث درباره پدیدهای موسوم به «بهینهسازی افراطی بنچمارک» را تقویت کرده است؛ رویکردی که در آن تنظیم مکرر دستورها، ابزارهای کمکی و منابع محاسباتی میتواند امتیاز آزمون را افزایش دهد، بدون آنکه لزوماً قابلیت اتکای واقعی مدل به همان میزان بهتر شود.
مقایسه با رقبا؛ پیشرفت واقعی یا افزایش هزینه محاسباتی؟
طبق دادههای OpenAI، GPT-6 Astra در برخی آزمونهای تخصصی، از جمله ریاضیات پیشرفته و مهندسی رایانه، نتایج بسیار بالایی کسب کرده است. بااینحال، ارزیابی مستقل شرکت Artificial Analysis نشان میدهد که امتیاز این مدل در شاخص کلی هوش این مؤسسه نسبت به نسل قبلی تغییر نکرده و همچنان از برخی رقبای بازار عقبتر است. گزارش همچنین به افت عملکرد مدل در بعضی آزمونهای مرتبط با وظایف شغلی واقعی، پشتیبانی مشتری و استدلال درباره اسناد طولانی اشاره میکند. از سوی دیگر، با وجود کاهش مصرف توکن در برخی وظایف، هزینه پایه استفاده از API این مدل نسبت به نسل قبلی افزایش یافته است.
آیا GPT-6 Astra آغاز عصر هوش عمومی مصنوعی است؟
GPT-6 Astra نشانهای از پیشرفت سیستمهای هوش مصنوعی در انجام وظایف پیچیده و حرکت به سمت عاملهای خودمختار است؛ سیستمهایی که میتوانند بهجای پاسخگویی صرف به پرسشها، مجموعهای از اقدامات را برای رسیدن به یک هدف اجرا کنند. بااینحال، توانایی انجام موفقیتآمیز وظایف مشخص با برخورداری از هوش عمومی انسانی یکسان نیست. برای اثبات AGI، باید قابلیت یادگیری در موقعیتهای تازه، استدلال پایدار، عملکرد قابلاعتماد و سازگاری با شرایط پیشبینینشده نیز بررسی شود. در نتیجه، هرچند GPT-6 Astra پیشرفتهای مهمی را نشان میدهد، شواهد مطرحشده در گزارش برای اثبات قطعی دستیابی به هوش عمومی مصنوعی کافی نیستند. ارزیابیهای مستقل، شفافیت در روشهای آزمایش و عملکرد مدل در دنیای واقعی همچنان برای تعیین جایگاه واقعی این فناوری ضروریاند.
منبع مقاله: livescience

شاهین آقامعلی


پاسخ :