
پژوهشگران نسبت به پدیدهای نگرانکننده در حوزه هوش مصنوعی هشدار دادهاند؛ پدیدهای که نشان میدهد یک عبارت کاملاً بیمعنی توانسته از طریق دادههای آموزشی وارد مدلهای زبانی بزرگ شود و حتی در مقالات علمی نیز تکرار شود. این عبارت که «Vegetative Electron Microscopy» یا «میکروسکوپ الکترونی رویشی» ترجمه میشود، هیچ مفهوم علمی معتبری ندارد، اما اکنون به نمونهای از تأثیر خطاهای داده بر عملکرد هوش مصنوعی تبدیل شده است.
بر اساس گزارش پژوهشگران، منشأ این عبارت به دهه ۱۹۵۰ بازمیگردد. در آن زمان، هنگام دیجیتالیسازی برخی مقالات قدیمی، نرمافزار تشخیص نوری کاراکتر (OCR) به اشتباه دو عبارت جداگانه «Vegetative» و «Electron Microscopy» را که در ستونهای مجاور قرار داشتند، با یکدیگر ادغام کرد. سالها بعد نیز در دو مقاله منتشرشده در سالهای ۲۰۱۷ و ۲۰۱۹، به دلیل یک اشتباه ترجمه از زبان فارسی، عبارت «Scanning Electron Microscopy» به اشتباه به «Vegetative Electron Microscopy» تبدیل شد. دلیل این خطا شباهت بسیار زیاد واژههای فارسی «روبشی» و «رویشی» است که تنها در یک نقطه تفاوت دارند.

این اشتباهها باعث شد عبارت نادرست در منابع علمی منتشر شود و سپس وارد مجموعه دادههایی شود که برای آموزش مدلهای هوش مصنوعی مورد استفاده قرار میگیرند. از آنجا که مدلهای زبانی، اطلاعات خود را از حجم عظیمی از دادههای اینترنتی و مقالات علمی استخراج میکنند، این عبارت را بهعنوان یک اصطلاح معتبر یاد گرفتند. طبق بررسیهای انجامشده، این عبارت تاکنون در دستکم ۲۲ مقاله علمی مشاهده شده است. برخی از این مقالات اصلاح یا حتی پس گرفته شدهاند، اما انتشار اولیه آنها کافی بود تا خطا در فضای علمی و سامانههای هوش مصنوعی گسترش پیدا کند. حتی یکی از روزنامههای معتبر اسپانیا نیز در سال ۲۰۲۳ از این عبارت در گزارش خود استفاده کرده بود.
پژوهشگران اعلام کردهاند که این خطا همچنان در مدلهای مطرحی مانند GPT-4o و Claude 3.5 دیده میشود. به گفته آنها، حذف چنین اشتباهی بسیار دشوار است، زیرا این مدلها اطلاعات را مانند یک پایگاه داده ذخیره نمیکنند، بلکه روابط آماری میان میلیاردها پارامتر را یاد میگیرند. بنابراین حتی اگر عبارت اصلی از اینترنت حذف شود، احتمال دارد همچنان در مدلهای آموزشدیده باقی بماند.
در همین حال، مطالعات جدید نشان میدهد استفاده از هوش مصنوعی در نگارش مقالات علمی بهسرعت در حال افزایش است. بررسی بیش از ۱۵ میلیون چکیده پزشکی نشان داده که حدود ۱۳.۵ درصد مقالات منتشرشده در سال ۲۰۲۴ با کمک مدلهای زبانی تولید یا ویرایش شدهاند. پژوهش دیگری نیز نشان میدهد که در برخی حوزههای علوم رایانه، بیش از ۲۰ درصد متن مقالات تحت تأثیر ابزارهای هوش مصنوعی قرار گرفته است.

کارشناسان تأکید میکنند که استفاده از هوش مصنوعی برای بهبود نگارش یا ویرایش متون علمی لزوماً غیراخلاقی نیست، اما زمانی مشکل ایجاد میشود که پژوهشگران بدون بررسی خروجیها، اطلاعات نادرست، منابع جعلی یا اصطلاحات ساختگی تولیدشده توسط مدلهای هوش مصنوعی را وارد مقالات کنند. به همین دلیل، ابزارهایی برای شناسایی محتوای تولیدشده با هوش مصنوعی توسعه یافتهاند، اما متخصصان معتقدند با افزایش حجم مقالات و نبود شفافیت درباره دادههای آموزشی مدلهای هوش مصنوعی، مقابله با این خطاها روزبهروز دشوارتر خواهد شد. این ماجرا نشان میدهد که حتی یک اشتباه کوچک در دادههای آموزشی میتواند سالها در ادبیات علمی و سامانههای هوش مصنوعی باقی بماند و بارها تکرار شود.
منبع خبر: zmescience

شاهین آقامعلی


پاسخ :