یک اشتباه تایپی، هوش مصنوعی را فریب داد؛ اصطلاحی جعلی وارد مقالات علمی شد

...

پژوهشگران نسبت به پدیده‌ای نگران‌کننده در حوزه هوش مصنوعی هشدار داده‌اند؛ پدیده‌ای که نشان می‌دهد یک عبارت کاملاً بی‌معنی توانسته از طریق داده‌های آموزشی وارد مدل‌های زبانی بزرگ شود و حتی در مقالات علمی نیز تکرار شود. این عبارت که «Vegetative Electron Microscopy» یا «میکروسکوپ الکترونی رویشی» ترجمه می‌شود، هیچ مفهوم علمی معتبری ندارد، اما اکنون به نمونه‌ای از تأثیر خطاهای داده بر عملکرد هوش مصنوعی تبدیل شده است.

بر اساس گزارش پژوهشگران، منشأ این عبارت به دهه ۱۹۵۰ بازمی‌گردد. در آن زمان، هنگام دیجیتالی‌سازی برخی مقالات قدیمی، نرم‌افزار تشخیص نوری کاراکتر (OCR) به اشتباه دو عبارت جداگانه «Vegetative» و «Electron Microscopy» را که در ستون‌های مجاور قرار داشتند، با یکدیگر ادغام کرد. سال‌ها بعد نیز در دو مقاله منتشرشده در سال‌های ۲۰۱۷ و ۲۰۱۹، به دلیل یک اشتباه ترجمه از زبان فارسی، عبارت «Scanning Electron Microscopy» به اشتباه به «Vegetative Electron Microscopy» تبدیل شد. دلیل این خطا شباهت بسیار زیاد واژه‌های فارسی «روبشی» و «رویشی» است که تنها در یک نقطه تفاوت دارند.

 

خطای هوش مصنوعی

 

این اشتباه‌ها باعث شد عبارت نادرست در منابع علمی منتشر شود و سپس وارد مجموعه داده‌هایی شود که برای آموزش مدل‌های هوش مصنوعی مورد استفاده قرار می‌گیرند. از آنجا که مدل‌های زبانی، اطلاعات خود را از حجم عظیمی از داده‌های اینترنتی و مقالات علمی استخراج می‌کنند، این عبارت را به‌عنوان یک اصطلاح معتبر یاد گرفتند. طبق بررسی‌های انجام‌شده، این عبارت تاکنون در دست‌کم ۲۲ مقاله علمی مشاهده شده است. برخی از این مقالات اصلاح یا حتی پس گرفته شده‌اند، اما انتشار اولیه آن‌ها کافی بود تا خطا در فضای علمی و سامانه‌های هوش مصنوعی گسترش پیدا کند. حتی یکی از روزنامه‌های معتبر اسپانیا نیز در سال ۲۰۲۳ از این عبارت در گزارش خود استفاده کرده بود.

پژوهشگران اعلام کرده‌اند که این خطا همچنان در مدل‌های مطرحی مانند GPT-4o و Claude 3.5 دیده می‌شود. به گفته آن‌ها، حذف چنین اشتباهی بسیار دشوار است، زیرا این مدل‌ها اطلاعات را مانند یک پایگاه داده ذخیره نمی‌کنند، بلکه روابط آماری میان میلیاردها پارامتر را یاد می‌گیرند. بنابراین حتی اگر عبارت اصلی از اینترنت حذف شود، احتمال دارد همچنان در مدل‌های آموزش‌دیده باقی بماند.

در همین حال، مطالعات جدید نشان می‌دهد استفاده از هوش مصنوعی در نگارش مقالات علمی به‌سرعت در حال افزایش است. بررسی بیش از ۱۵ میلیون چکیده پزشکی نشان داده که حدود ۱۳.۵ درصد مقالات منتشرشده در سال ۲۰۲۴ با کمک مدل‌های زبانی تولید یا ویرایش شده‌اند. پژوهش دیگری نیز نشان می‌دهد که در برخی حوزه‌های علوم رایانه، بیش از ۲۰ درصد متن مقالات تحت تأثیر ابزارهای هوش مصنوعی قرار گرفته است.

 

خطای هوش مصنوعی

 

کارشناسان تأکید می‌کنند که استفاده از هوش مصنوعی برای بهبود نگارش یا ویرایش متون علمی لزوماً غیراخلاقی نیست، اما زمانی مشکل ایجاد می‌شود که پژوهشگران بدون بررسی خروجی‌ها، اطلاعات نادرست، منابع جعلی یا اصطلاحات ساختگی تولیدشده توسط مدل‌های هوش مصنوعی را وارد مقالات کنند. به همین دلیل، ابزارهایی برای شناسایی محتوای تولیدشده با هوش مصنوعی توسعه یافته‌اند، اما متخصصان معتقدند با افزایش حجم مقالات و نبود شفافیت درباره داده‌های آموزشی مدل‌های هوش مصنوعی، مقابله با این خطاها روزبه‌روز دشوارتر خواهد شد. این ماجرا نشان می‌دهد که حتی یک اشتباه کوچک در داده‌های آموزشی می‌تواند سال‌ها در ادبیات علمی و سامانه‌های هوش مصنوعی باقی بماند و بارها تکرار شود.

منبع خبر: zmescience

نظرات 0

wave

ارسال نظر

wave
برای ثبت نظر ابتدا وارد حساب کاربری خود شوید. ورود | ثبت نام

در آرتیجنس دنبال چی میگردی؟