جنجال بنچمارک Grok 3: آیا xAI در مورد عملکرد آن اغراق کرده است؟
به گزارش نگاه فناوری:در دنیای پیچیده هوش مصنوعی، مقایسه مدلها و گزارش عملکرد آنها همواره به بحثهای داغ و چالشبرانگیز تبدیل شده است. اخیراً، شرکت xAI متعلق به ایلان ماسک، سازنده مدل هوش مصنوعی Grok 3، با اتهاماتی مبنی بر ارائه اطلاعات گمراهکننده در مورد عملکرد این مدل جدید مواجه شده است. این اتهامات توسط یکی از کارکنان OpenAI، رقیب اصلی xAI، مطرح شده و واکنشهای مختلفی را در پی داشته است. در حالی که ایگور بابوشکین، یکی از مهندسان ارشد xAI، قویاً از نتایج منتشر شده دفاع میکند، ابهاماتی در مورد نحوه محاسبه و ارائه این نتایج وجود دارد.
ماجرای انتشار بنچمارکهای Grok 3
xAI در اقدامی بحثبرانگیز، نموداری را در وبلاگ رسمی خود منتشر کرد که نشان میداد Grok 3 در بنچمارک AIME 2025 نسبت به مدل o3-mini-high از OpenAI عملکرد بهتری دارد. بنچمارک AIME 2025، مجموعهای از سؤالات ریاضی دشوار است که برای ارزیابی توانایی ریاضی مدلهای هوش مصنوعی مورد استفاده قرار میگیرد. با این حال، اعتبار AIME به عنوان یک معیار استاندارد برای سنجش مدلهای هوش مصنوعی توسط برخی از کارشناسان زیر سؤال رفته است.

ابهامات و تناقضات در دادههای منتشر شده
کارکنان OpenAI با بررسی دقیقتر نمودار منتشر شده توسط xAI، متوجه شدند که امتیاز مدل o3-mini-high در متریک cons@64 در نظر گرفته نشده است. متریک cons@64 که مخفف consensus@64 است، به مدل اجازه میدهد 64 بار برای حل هر مسئله تلاش کند و پاسخ پرتکرارترین خروجی را به عنوان جواب نهایی ثبت کند. این روش در بسیاری از موارد بهبود قابل توجهی در امتیازات مدلها ایجاد میکند؛ بنابراین، حذف این معیار از مقایسهها میتواند تصویر نادرستی از برتری Grok 3 ایجاد کند.
بر اساس بررسیهای دقیقتر، مدلهای Grok 3 Reasoning Beta و Grok 3 mini Reasoning در متریک @1 (اولین پاسخ تولیدی مدل) امتیاز پایینتری نسبت به o3-mini-high دارند. علاوه بر این، مدل Grok 3 Reasoning Beta حتی در مقایسه با مدل o1-medium از OpenAI نیز عملکرد پایینتری دارد. با این وجود، xAI همچنان Grok 3 را باهوشترین هوش مصنوعی جهان معرفی میکند که این موضوع با ابهامات موجود در دادهها در تضاد است.

پاسخ xAI و ابهامات بیشتر
بابوشکین در پاسخ به انتقادات مطرح شده، OpenAI را به مقایسههای مشابه متهم کرد و اشاره کرد که آنها نیز در گذشته نمودارهای گمراهکننده منتشر کردهاند. این موضوع نشان میدهد که بحث و جدل بر سر نحوه مقایسه و ارزیابی مدلهای هوش مصنوعی همچنان ادامه دارد و شفافیت بیشتری در این زمینه ضروری است.
به گفته نیتن لمبرت، یکی از محققان هوش مصنوعی، یکی از مهمترین نکاتی که در این مقایسهها نادیده گرفته شده، هزینههای رسیدن به بهترین عملکرد است. بدون دانستن این اطلاعات، مقایسه عملکرد مدلها نمیتواند تصویری واقعی از تواناییهای آنها ارائه دهد. به نظر میرسد که در دنیای هوش مصنوعی، رقابت برای کسب عنوان “باهوشترین” مدل، گاهی اوقات منجر به ارائه اطلاعات ناقص و گمراهکننده میشود که این موضوع میتواند اعتماد کاربران و جامعه علمی را نسبت به این فناوری خدشهدار کند.









