
شرکت هوش مصنوعی Pathway در مقالهای پژوهشی که ۱۰ اوت روی سرور پیشچاپ arXiv منتشر شد، از مدل جدیدی به نام BDH-CQ رونمایی کرد؛ مدلی که با رویکردی متفاوت نسبت به معماریهای رایج، هزینه پردازش درخواستهای هوش مصنوعی را بهشکل چشمگیری کاهش میدهد. این مدل ادامهی پروژهی «دراگون هچلینگ» (Dragon Hatchling) است که در سال ۲۰۲۵ برای شبیهسازی دقیق نحوهی اتصال و تقویت نورونهای مغز طراحی شده بود.
عملکرد در بنچمارک ARC-AGI
پژوهشگران عملکرد BDH-CQ را با بنچمارک معروف ARC-AGI که از سال ۲۰۱۹ بهعنوان معیاری برای سنجش پیشرفت بهسوی هوش مصنوعی عمومی (AGI) شناخته میشود، مقایسه کردند. این آزمون از پازلهای استدلال غیرکلامی، مانند چرخاندن مجموعهای از اشکال برای تکمیل یک الگو، بهره میبرد؛ کاری که انسانها در آن مهارت بالایی دارند اما مدلهای اولیهی هوش مصنوعی معمولاً در آن ضعیف بودهاند. BDH-CQ توانست نزدیک به ۳۰ درصد از سؤالات ARC-AGI-1 را با دو تلاش یا کمتر حل کند. هرچند برخی مدلهای دیگر امتیاز بالاتری کسب کردهاند، نکتهی قابل توجه این است که مدل سبک استدلالی OpenAI با نام GPT 5.6 Luna (نسخهی سبک) برای کسب امتیازی اندکی بالاتر، حدود ۱۱ برابر بیشتر از BDH-CQ توکن مصرف کرده است.
مدلی کوچک با پتانسیل بزرگ
BDH-CQ تنها با ۱۵۰ میلیون پارامتر آموزش دیده، در حالی که مدلهای پیشرفتهی امروزی مانند Llama 3 70B یا Llama 3.1 405B متعلق به متا، دهها تا صدها میلیارد پارامتر دارند. پارامتر کمتر یعنی آموزش سریعتر و اجرای ارزانتر. پژوهشگران معتقدند این نتایج نشان میدهد تواناییهای شناختی مدل در صورت افزایش اندازه، میتواند بهطور قابلتوجهی رشد کند.
تفاوت معماری «پسا-ترنسفورمر» با ترنسفورمرهای رایج
اغلب مدلهای زبانی بزرگ امروزی، از جمله Claude و ChatGPT، بر پایهی معماری ترنسفورمر ساخته شدهاند؛ معماریای که تمام بخشهای یک ورودی را همزمان بررسی و به بردارهای ریاضی تبدیل میکند. این مدلها پاسخ را کلمهبهکلمه و بهصورت خطی تولید میکنند، اما با طولانیترشدن ورودی، پیچیدگی محاسباتی بهصورت درجهدوم افزایش مییابد؛ یعنی دوبرابر شدن طول ورودی، چهار برابر قدرت پردازشی میطلبد. این موضوع باعث میشود پردازش پرسشهای پیچیده، توکن زیادی مصرف کند و در نهایت به گلوگاه حافظه در پردازندههای گرافیکی (GPU) منجر شود.

در مقابل، معماری پسا-ترنسفورمر Pathway بهجای ذخیرهی مکالمات بهصورت رشتههای متنی طولانی، از آرایههای عددی برای نمایش روابط میان قطعات اطلاعات استفاده میکند. این آرایهها بردارهایی هستند که به نقاط دیگری در نقشهای ذهنی ذخیرهشده در حافظهی GPU اشاره میکنند و امکان استدلال انتزاعی پیچیده را بدون افزایش مصرف حافظه یا محاسبات فراهم میکنند.
مدل از یک «موتور استدلال نهفته» (Latent Reasoning Engine) بهعنوان فضای کاری داخلی استفاده میکند که طی حلقههای تکراری، خروجی هر مرحله را ارزیابی و برای دور بعدی بهبود میدهد. برای مسائل پیچیدهتر، مدل میتواند حلقههای بیشتری اجرا کند، بدون آنکه مصرف حافظه و توان پردازشی به همان نسبت افزایش یابد؛ ویژگیای که آن را از مدلهای ترنسفورمری متمایز میکند.
تأیید مستقل نتایج
نتایج بنچمارک ARC-AGI-1 این مدل توسط پژوهشگران شناختهشدهای از جمله ریچارد ژونگ از دانشگاه نیویورک و لوکاش کایزر، یکی از نویسندگان مقالهی تاریخی «Attention Is All You Need» (مقالهای که مفهوم ترنسفورمرها را معرفی کرد)، بهطور مستقل بازتولید و تأیید شده است. کایزر در این باره گفته است که معماری مدل، نهفقط مقیاس آن، میتواند جهش بعدی در استدلال هوش مصنوعی را رقم بزند.
برنامههای آیندهی Pathway
شرکت Pathway قصد دارد معماری BDH را تا ۶۰۰ میلیارد پارامتر مقیاسبندی کند و استدلال مبتنی بر بردار آن را روی بنچمارکهای چالشبرانگیزتری مانند ARC-AGI-2 و ARC-AGI-3 بیازماید. همچنین توسعهی یک مدل زبانی بزرگ کامل بر پایهی این فناوری، برای ساخت چتباتهای متنی، در دستور کار این شرکت قرار دارد. به گفتهی این شرکت، این فناوری میتواند در حوزههایی مانند پاسخ به حوادث امنیت سایبری و عملیات صنعتی نیز کاربرد داشته باشد.
منبع خبر: livescience

شاهین آقامعلی


پاسخ :