دلار آمریکا۲۶۸٬۷۰۰• ۰٪یورو۳۰۱٬۶۸۰• ۰٪درهم امارات۷۳٬۴۰۳• ۰٪سکه امامی۲۷۰٬۹۳۰٬۰۰۰• ۰٪طلای ۱۸ عیار۲۶٬۵۴۷٬۲۰۰• ۰٪انس طلا۴٬۱۴۰ $▼ ۰٫۰۲٪تتر۲۶۸٬۹۳۱• ۰٪بیت‌کوین۸۵٬۷۷۱ $▼ ۰٫۰۳٪اتریوم۲٬۷۱۲ $▲ ۰٪سولانا۱۲۰٫۶۴ $▲ ۰٫۲۹٪
همه نرخ‌ها

آیا ادعای برتری Grok 3 واقعی است؟ اختلاف نظر xAI و OpenAI

در دنیای پیچیده هوش مصنوعی، مقایسه مدل‌ها و گزارش عملکرد آنها همواره به بحث‌های داغ و چالش‌برانگیز تبدیل شده است.

آیا ادعای برتری Grok 3 واقعی است؟ اختلاف نظر xAI و OpenAI
آیا ادعای برتری Grok 3 واقعی است؟ اختلاف نظر xAI و OpenAI
فهرست مطالب
  1. جنجال بنچمارک Grok 3: آیا xAI در مورد عملکرد آن اغراق کرده است؟

جنجال بنچمارک Grok 3: آیا xAI در مورد عملکرد آن اغراق کرده است؟

به گزارش نگاه فناوری:در دنیای پیچیده هوش مصنوعی، مقایسه مدل‌ها و گزارش عملکرد آنها همواره به بحث‌های داغ و چالش‌برانگیز تبدیل شده است. اخیراً، شرکت xAI متعلق به ایلان ماسک، سازنده مدل هوش مصنوعی Grok 3، با اتهاماتی مبنی بر ارائه اطلاعات گمراه‌کننده در مورد عملکرد این مدل جدید مواجه شده است. این اتهامات توسط یکی از کارکنان OpenAI، رقیب اصلی xAI، مطرح شده و واکنش‌های مختلفی را در پی داشته است. در حالی که ایگور بابوشکین، یکی از مهندسان ارشد xAI، قویاً از نتایج منتشر شده دفاع می‌کند، ابهاماتی در مورد نحوه محاسبه و ارائه این نتایج وجود دارد.

ماجرای انتشار بنچمارک‌های Grok 3

xAI در اقدامی بحث‌برانگیز، نموداری را در وبلاگ رسمی خود منتشر کرد که نشان می‌داد Grok 3 در بنچمارک AIME 2025 نسبت به مدل o3-mini-high از OpenAI عملکرد بهتری دارد. بنچمارک AIME 2025، مجموعه‌ای از سؤالات ریاضی دشوار است که برای ارزیابی توانایی ریاضی مدل‌های هوش مصنوعی مورد استفاده قرار می‌گیرد. با این حال، اعتبار AIME به عنوان یک معیار استاندارد برای سنجش مدل‌های هوش مصنوعی توسط برخی از کارشناسان زیر سؤال رفته است.

آیا ادعای برتری Grok 3 واقعی است؟ اختلاف نظر xAI و OpenAI

ابهامات و تناقضات در داده‌های منتشر شده

کارکنان OpenAI با بررسی دقیق‌تر نمودار منتشر شده توسط xAI، متوجه شدند که امتیاز مدل o3-mini-high در متریک cons@64 در نظر گرفته نشده است. متریک cons@64 که مخفف consensus@64 است، به مدل اجازه می‌دهد 64 بار برای حل هر مسئله تلاش کند و پاسخ پرتکرارترین خروجی را به عنوان جواب نهایی ثبت کند. این روش در بسیاری از موارد بهبود قابل توجهی در امتیازات مدل‌ها ایجاد می‌کند؛ بنابراین، حذف این معیار از مقایسه‌ها می‌تواند تصویر نادرستی از برتری Grok 3 ایجاد کند.

بر اساس بررسی‌های دقیق‌تر، مدل‌های Grok 3 Reasoning Beta و Grok 3 mini Reasoning در متریک @1 (اولین پاسخ تولیدی مدل) امتیاز پایین‌تری نسبت به o3-mini-high دارند. علاوه بر این، مدل Grok 3 Reasoning Beta حتی در مقایسه با مدل o1-medium از OpenAI نیز عملکرد پایین‌تری دارد. با این وجود، xAI همچنان Grok 3 را باهوش‌ترین هوش مصنوعی جهان معرفی می‌کند که این موضوع با ابهامات موجود در داده‌ها در تضاد است.

آیا ادعای برتری Grok 3 واقعی است؟ اختلاف نظر xAI و OpenAI

پاسخ xAI و ابهامات بیشتر

بابوشکین در پاسخ به انتقادات مطرح شده، OpenAI را به مقایسه‌های مشابه متهم کرد و اشاره کرد که آنها نیز در گذشته نمودارهای گمراه‌کننده منتشر کرده‌اند. این موضوع نشان می‌دهد که بحث و جدل بر سر نحوه مقایسه و ارزیابی مدل‌های هوش مصنوعی همچنان ادامه دارد و شفافیت بیشتری در این زمینه ضروری است.

به گفته نیتن لمبرت، یکی از محققان هوش مصنوعی، یکی از مهم‌ترین نکاتی که در این مقایسه‌ها نادیده گرفته شده، هزینه‌های رسیدن به بهترین عملکرد است. بدون دانستن این اطلاعات، مقایسه عملکرد مدل‌ها نمی‌تواند تصویری واقعی از توانایی‌های آنها ارائه دهد. به نظر می‌رسد که در دنیای هوش مصنوعی، رقابت برای کسب عنوان "باهوش‌ترین" مدل، گاهی اوقات منجر به ارائه اطلاعات ناقص و گمراه‌کننده می‌شود که این موضوع می‌تواند اعتماد کاربران و جامعه علمی را نسبت به این فناوری خدشه‌دار کند.

نظر شما

—
هنوز رأیی ثبت نشده
  1. ۵۰
  2. ۴۰
  3. ۳۰
  4. ۲۰
  5. ۱۰

این مطلب چقدر به کارتان آمد؟

روی ستاره‌ها بزنید

واکنش شما

اولین نفری باشید که واکنش نشان می‌دهد.

خطایی در این مطلب دیدید؟ به تحریریه گزارش دهید؛ اصلاحیه‌ها طبق اصول تحریریه ثبت می‌شوند.

نویسنده

نویسنده

نویسنده اخبار فناوری، موبایل و هوش مصنوعی در نگاه فناوری.

همه مطالب زهرا صفاری

دیدگاه‌ها

۰/۲٬۰۰۰

دیدگاه‌ها پس از بررسی تحریریه منتشر می‌شوند. توهین، تبلیغ و لینک‌های بی‌ربط حذف می‌شوند؛ نقد فنی و مستند همیشه خوش‌آمد است.

هنوز دیدگاهی ثبت نشده است. اولین نفری باشید که نظرش را می‌نویسد.

مطالب مرتبط