دلار آمریکا۲۶۸٬۷۰۰• ۰٪یورو۳۰۱٬۶۸۰• ۰٪درهم امارات۷۳٬۴۰۳• ۰٪سکه امامی۲۷۰٬۹۳۰٬۰۰۰• ۰٪طلای ۱۸ عیار۲۶٬۵۴۷٬۲۰۰• ۰٪انس طلا۴٬۱۴۰ $▼ ۰٫۰۲٪تتر۲۶۸٬۹۳۱• ۰٪بیت‌کوین۸۵٬۷۷۱ $▼ ۰٫۰۳٪اتریوم۲٬۷۱۲ $▲ ۰٪سولانا۱۲۰٫۶۴ $▲ ۰٫۲۹٪
همه نرخ‌ها

تحقیق جدید: مدل‌های پیشرفته OpenAI استدلال بهتری دارند، اما بیشتر هذیان می‌گویند!

یافته‌ای که ممکن است صنعت هوش مصنوعی را به چالش بکشد، تحقیقات جدید نشان می‌دهد مدل‌های زبان پیشرفته OpenAI با وجود بهبود چشمگیر در توانایی استدلال، به طرز عجیبی مستعدتر به تولید اطلاعات نادرست شده‌اند!

تحقیق جدید: مدل‌های پیشرفته OpenAI استدلال بهتری دارند، اما بیشتر هذیان می‌گویند!
تحقیق جدید: مدل‌های پیشرفته OpenAI استدلال بهتری دارند، اما بیشتر هذیان می‌گویند!

به گزارش نگاه فناوری:یافته‌ای که ممکن است صنعت هوش مصنوعی را به چالش بکشد، تحقیقات جدید نشان می‌دهد مدل‌های زبان پیشرفته OpenAI با وجود بهبود چشمگیر در توانایی استدلال، به طرز عجیبی مستعدتر به تولید اطلاعات نادرست شده‌اند! این پارادوکس نگران‌کننده که "پیشرفت به قیمت افزایش توهمات" را نشان می‌دهد، جامعه AI را با سوالات جدی مواجه کرده است.

شرکت OpenAI، به عنوان یکی از پیشگامان توسعه‌ی مدل‌های هوش مصنوعی، اخیراً از مدل‌های جدید خود با نام‌های o3 و o4-mini رونمایی کرده است. این مدل‌ها، طبق اعلام این شرکت، در زمینه‌هایی نظیر کدنویسی و حل مسائل ریاضی، عملکرد بهتری را نسبت به مدل‌های قبلی از خود نشان می‌دهند. با این حال، نتایج بررسی‌های داخلی حاکی از آن است که این پیشرفت‌ها با یک چالش جدی همراه شده است؛ به طوری که این مدل‌های جدید، بیشتر از نسل‌های پیشین خود دچار پدیده‌ای موسوم به «توهم» می‌شوند. منظور از «توهم» در این context، تمایل مدل‌های زبانی بزرگ به تولید اطلاعات نادرست یا بی‌اساس است؛ مشکلی که از دیرباز در این حوزه مطرح بوده و اکنون به نظر می‌رسد با شدت بیشتری بازگشته است.

بر اساس داده‌های به دست آمده از تست‌های داخلی OpenAI، مدل o3 در حدود ۳۳ درصد از پاسخ‌های خود در آزمون PersonQA دچار توهم شده و اطلاعات نادرست ارائه کرده است. این در حالی است که مدل‌های قبلی این شرکت، مانند o1 و o3-mini، نرخ توهم به مراتب پایین‌تری و در حدود ۱۵ درصد داشته‌اند. عملکرد مدل o4-mini حتی از این نیز ضعیف‌تر گزارش شده است، به طوری که این مدل در حدود ۴۸ درصد از موارد، اطلاعات اشتباه و گمراه‌کننده تولید کرده است. این افزایش چشمگیر در نرخ توهم می‌تواند نگرانی‌های جدی را در مورد قابلیت اطمینان و دقت این مدل‌های پیشرفته ایجاد کند.

علاوه بر این، محققان شرکت Transluce در گزارش‌های خود اشاره کرده‌اند که مدل o3 در برخی موارد، اقداماتی ساختگی را گزارش می‌کند؛ به عنوان مثال، این مدل ممکن است ادعا کند که کدی را در محیطی خارج از توانایی‌های خود اجرا کرده است. به گفته‌ی این محققان، روش آموزش تقویتی که برای این مدل‌ها به کار گرفته می‌شود، می‌تواند یکی از عوامل اصلی در تقویت چنین رفتارهای غیرواقعی باشد. به عبارت دیگر، ممکن است فرآیند آموزش به گونه‌ای باشد که مدل را به تولید پاسخ‌هایی که از نظر آماری محتمل به نظر می‌رسند، حتی اگر با واقعیت تطابق نداشته باشند، تشویق کند.

اگرچه در برخی کاربردهای عملی، مانند استفاده از مدل o3 در شرکت Workera برای برنامه‌نویسی، نتایج نسبتاً رضایت‌بخش گزارش شده است، اما وجود پاسخ‌های ساختگی همچنان دقت کلی این مدل را زیر سؤال می‌برد. این مسئله به ویژه در مشاغل و زمینه‌های حساسی مانند وکالت یا درمان، که صحت و دقت اطلاعات از اهمیت حیاتی برخوردار است، می‌تواند مشکلات جدی و پیامدهای ناگواری را به دنبال داشته باشد. به عنوان مثال، ارائه‌ی اطلاعات حقوقی یا پزشکی نادرست توسط یک مدل هوش مصنوعی می‌تواند منجر به تصمیمات اشتباه و خسارات جبران‌ناپذیری شود.

یکی از راهکارهای پیشنهادی که برای کاهش پدیده‌ی توهم در مدل‌های زبانی بزرگ مطرح شده است، استفاده از ابزارهای جست‌وجوی وب در این مدل‌ها است. این قابلیت، که به عنوان مثال در مدل GPT-4o نیز به کار گرفته شده و منجر به افزایش دقت آن شده است، به مدل امکان می‌دهد تا در صورت نیاز به اطلاعات خارجی دسترسی پیدا کرده و پاسخ‌های خود را بر اساس داده‌های معتبر و به‌روز ارائه دهد. با این حال، با گسترش ویژگی‌ها و افزایش توانایی‌های استدلالی مدل‌های هوش مصنوعی و در عین حال افزایش تمایل آن‌ها به تولید اطلاعات نادرست، یافتن یک راه حل قطعی و اساسی برای این مشکل از اهمیت فزاینده‌ای برخوردار می‌شود. محققان و توسعه‌دهندگان در این حوزه باید تلاش‌های خود را برای درک بهتر ریشه‌های این پدیده و ابداع روش‌های مؤثر برای کاهش آن به کار گیرند تا بتوان از پتانسیل کامل این فناوری در زمینه‌های مختلف بهره‌مند شد و از بروز مشکلات ناشی از اطلاعات نادرست جلوگیری کرد.

نظر شما

—
هنوز رأیی ثبت نشده
  1. ۵۰
  2. ۴۰
  3. ۳۰
  4. ۲۰
  5. ۱۰

این مطلب چقدر به کارتان آمد؟

روی ستاره‌ها بزنید

واکنش شما

اولین نفری باشید که واکنش نشان می‌دهد.

خطایی در این مطلب دیدید؟ به تحریریه گزارش دهید؛ اصلاحیه‌ها طبق اصول تحریریه ثبت می‌شوند.

نویسنده

نویسنده

نویسنده اخبار فناوری، موبایل و هوش مصنوعی در نگاه فناوری.

همه مطالب زهرا صفاری

دیدگاه‌ها

۰/۲٬۰۰۰

دیدگاه‌ها پس از بررسی تحریریه منتشر می‌شوند. توهین، تبلیغ و لینک‌های بی‌ربط حذف می‌شوند؛ نقد فنی و مستند همیشه خوش‌آمد است.

هنوز دیدگاهی ثبت نشده است. اولین نفری باشید که نظرش را می‌نویسد.

مطالب مرتبط