معرفی DeepSeek R2: هوش مصنوعی نسل جدید با هزینه ۹۷ درصد کمتر از GPT-4
به گزارش نگاه فناوری:بر اساس اطلاعات منتشر شده توسط یک افشاگر در چین، استارتاپ نوآور دیپسیک (DeepSeek) در آستانه معرفی مدل جدید و پیشرفتهی هوش مصنوعی خود با نام DeepSeek R2 قرار دارد. پس از موفقیت چشمگیر مدل قبلی این شرکت، یعنی DeepSeek R1، که توانست توانمندیهای چین در توسعهی مدلهای هوش مصنوعی پیشرفته را به اثبات برساند، انتظار میرود که مدل R2 نیز با قابلیتهای منحصربهفرد خود، بار دیگر توجهات بازار جهانی را به خود جلب کند.
گفته میشود که DeepSeek R2 از یک معماری ترکیبی به نام Mixture of Experts (MoE) بهره میبرد که به عنوان نسخهای تکاملیافتهتر از معماریهای فعلی در نظر گرفته میشود. این معماری احتمالاً شامل مکانیزمهای گیتینگ پیشرفته یا ترکیبی هوشمندانه از لایههای MoE و Dense خواهد بود که به منظور بهینهسازی عملکرد در پردازشهای سنگین و پیچیده طراحی شده است. انتظار میرود که این مدل با مجموعهای بالغ بر ۱.۲ تریلیون پارامتر عرضه شود؛ رقمی که DeepSeek R2 را در سطح مدلهای قدرتمندی همچون GPT-4 Turbo و Gemini 2.0 Pro قرار میدهد و نشان از تواناییهای پردازشی قابل توجه آن دارد.
یکی از نکات بسیار حائز اهمیت در مورد DeepSeek R2، کاهش چشمگیر هزینههای پردازش در مقایسه با مدل پیشین و قدرتمند GPT-4 است. بر اساس اطلاعات فاش شده، هزینه پردازش برای هر یک میلیون توکن ورودی در مدل R2 حدود ۰.۰۷ دلار و برای هر یک میلیون توکن خروجی حدود ۰.۲۷ دلار خواهد بود. این کاهش قابل توجه در هزینه میتواند DeepSeek R2 را به یک گزینه بسیار مقرونبهصرفه و جذاب برای سازمانها و شرکتهای مختلف تبدیل کند که به دنبال استفاده از قابلیتهای پیشرفتهی هوش مصنوعی در مقیاس بزرگ هستند.
در میان دیگر جزئیات فنی که از این مدل فاش شده است، میتوان به استفادهی DeepSeek R2 از یک خوشهی پردازشی قدرتمند اشاره کرد که مبتنی بر تراشههای Ascend 910B ساخت شرکت هواوی است. این خوشه از توان پردازشی بالغ بر ۵۱۲ پتافلاپس (با دقت FP16) برخوردار است. این موضوع نشان میدهد که استارتاپ دیپسیک با تکیه بر منابع داخلی و توانمندیهای ملی، زنجیرهی تأمین هوش مصنوعی خود را به طور کامل یکپارچه کرده است و در این زمینه به خودکفایی رسیده است.









