در کمتر از یک هفته، نام Kimi K3 از یک شایعهٔ فایننشالتایمز به یکی از داغترین بحثهای سیلیکونولی تبدیل شد. شرکت چینی Moonshot AI مدلی با حدود ۲٫۸ تریلیون پارامتر معرفی کرد که خودش آن را «اولین مدل کلاس ۳ تریلیون پارامتر که قرار است با وزنهای باز منتشر شود» مینامد (وزنها هنوز منتشر نشده و انتشارشان برای ۲۷ ژوئیه وعده داده شده است)؛ مدلی با پنجرهٔ بافت ۱ میلیون توکن، معماری Mixture of Experts، قابلیت بینایی بومی، و وعدهٔ انتشار وزنهای کامل تا ۲۷ ژوئیهٔ ۲۰۲۶. تا آن تاریخ، دسترسی اصلی از طریق اپ و API رسمی است — نه دانلود آزاد وزنها.
این خبر فقط یک آپدیت فنی نیست. همزمان با سخنرانی شی جینپینگ در کنفرانس جهانی هوش مصنوعی شانگهای، نزدک حدود ۱٪ افت کرد و سهام تراشهسازانی مثل انویدیا زیر فشار فروش رفت؛ تککرانچ این همزمانی را محتاطانه با نگرانی بازار از مدلهای چینی مرتبط دانسته است. بحث قدیمی پس از شوک DeepSeek دوباره زنده شد — فقط اینبار با جنگ تعرفهای، دغدغهٔ امنیت ملی، و حساسیت آزمایشگاههای آمریکایی نسبت به مدلهای با وزن باز (Open-Weight) تندتر شده است.
در این گزارش جامع، از مشخصات فنی و بنچمارکها تا مقایسه با OpenAI و Anthropic، واکنش والاستریت، جدال ژئوپلیتیک، و معنای عملی برای توسعهدهندگان فارسیزبان را بررسی میکنیم.
Kimi K3 چیست و چرا تا این حد سروصدا کرده است؟
Kimi K3 پرچمدار جدید Moonshot AI است که ۱۶ ژوئیهٔ ۲۰۲۶ روی kimi.com، Kimi Work، Kimi Code و API رسمی در دسترس قرار گرفت. طبق بلاگ فنی خود شرکت:
۲٫۸ تریلیون پارامتر کل · معماری Mixture of Experts (MoE) با فعالسازی ۱۶ از ۸۹۶ کارشناس · پنجرهٔ بافت ۱ میلیون توکن · ورودی متن و تصویر (بینایی بومی)؛ پشتیبانی از ویدئو در برخی ابزارهای Kimi · الگوریتمهای Kimi Delta Attention (KDA) و Attention Residuals · انتشار وزنهای کامل تا ۲۷ ژوئیهٔ ۲۰۲۶.
نکتهٔ کلیدی برای درک هیاهو این است: مونشات صراحتاً میگوید عملکرد کلی K3 هنوز از قویترین مدلهای اختصاصی یعنی Claude Fable 5 و GPT-5.6 Sol عقب است؛ اما در مجموعهٔ ارزیابیهایش عملکرد سطح frontier داشته و از مدلهای همردهٔ بازتر جلو زده است. تحلیلهای مستقل Arena.ai و Vals AI هم نشانههایی از رقابتپذیری آن با پرچمداران frontier نشان دادهاند.
پیش از عرضه، فایننشالتایمز به نقل از منابع ناشناس نوشته بود Kimi K3 فاصله با Claude Opus 4.8 را کم میکند یا حتی از آن جلو میزند، بین ۲ تا ۳ تریلیون پارامتر دارد، و مونشات در حال جذب سرمایه با ارزشگذاری حدود ۳۱٫۵ میلیارد دلار است (پس از جذب ۲ میلیارد دلار در مه با ارزشگذاری ۲۰ میلیارد).
بررسی عمیق فنی: چین چطور با معماری نرمافزاری جلو آمد؟
محدودیت صادرات تراشههای پیشرفتهٔ انویدیا به چین یکی از محورهای رقابت آمریکا–چین بوده است. پاسخ مونشات در K3 بیشتر معماری و بهرهوری است تا صرفاً خرید GPU بیشتر.
۱) Mixture of Experts پویا: ۲٫۸ تریلیون، اما نه همه با هم
در MoE، مدل به کارشناسهای تخصصی تقسیم میشود و برای هر توکن فقط بخشی روشن میشود. در K3 با چارچوب Stable LatentMoE، از ۸۹۶ کارشناس فقط ۱۶ تا فعال میشوند. نتیجه: مقیاس پارامتری عظیم با هزینهٔ استنتاج قابلکنترلتر نسبت به فعالکردن تمام پارامترها. مونشات میگوید این تغییرات به همراه دستور پخت آموزش، حدود ۲٫۵ برابر بهبود بهرهوری مقیاس نسبت به Kimi K2 ایجاد کرده است.
۲) Kimi Delta Attention و Attention Residuals
KDA یک مکانیزم توجه هیبریدی/خطی است که برای نگهداشتن جریان اطلاعات در توالیهای خیلی بلند طراحی شده؛ مونشات ادعا میکند در بافتهای میلیونتوکنی تا حدود ۶٫۳ برابر رمزگشایی سریعتر ممکن است. AttnRes هم نحوهٔ عبور اطلاعات در عمق شبکه را عوض میکند؛ طبق گزارشهای تیم Kimi، آزمایشهای scaling مزیت محاسباتی حدود ۱٫۲۵ برابر را نشان دادهاند و سربار تأخیر استنتاج در بارهای معمول کمتر از ۲٪ گزارش شده است. اینها فعلاً ادعا و نتایج خود تیم هستند، نه تأیید مستقل کامل روی نسخهٔ نهایی.
۳) پنجرهٔ بافت ۱ میلیون توکن
یک میلیون توکن یعنی امکان نگه داشتن حجم بسیار بیشتری از کد، اسناد، یا تاریخچهٔ یک نشست ایجنت چندساعته در یک زمینه. این قابلیت برای کدنویسی ایجنتیک و پژوهش مفید است، اما پنجرهٔ بزرگ بهتنهایی تضمین نمیکند مدل همهٔ جزئیات را دقیق به خاطر بسپارد.
۴) کوانتیزیشن و استقرار
از مرحلهٔ SFT به بعد آموزش آگاهازکوانتیزیشن با وزنهای MXFP4 و فعالسازی MXFP8 گزارش شده تا سازگاری سختافزاری گسترده شود. مونشات برای استنتاج در مقیاس بزرگ، پیکربندیهای ابرگره با ۶۴ شتابدهنده یا بیشتر را توصیه میکند و پیادهسازی مرتبط با کش پیشوند KDA را به جامعهٔ vLLM وعده داده است.
بنچمارکها: کجا میبرد، کجا عقب میماند؟
اعداد زیر خلاصهای از گزارشهای بلاگ رسمی و جمعبندیهای مستقل است. ارزیابیها عمدتاً در بالاترین سطح استدلال انجام شدهاند، اما harness (مثل KimiCode، Claude Code، Codex)، سختافزار و روش اجرا یکسان نبوده؛ بنابراین این مقایسه تقریبی است، نه آزمایش کاملاً کنترلشده.
کدنویسی: در Program Bench حدود ۷۷٫۸ (بالاتر از Fable 5 و GPT-5.6 Sol در همان جدول) · در SWE Marathon حدود ۴۲٫۰ (بالاترین در جدول گزارششده) · در Terminal-Bench 2.1 حدود ۸۸٫۳ (نزدیک به ۸۸٫۸ سول) · در FrontierSWE حدود ۸۱٫۲ (دوم بعد از Fable 5) · در DeepSWE حدود ۶۷٫۳ (عقبتر از Sol و Fable).
فرانتاند و ترجیح انسانی: در Frontend Code Arena امتیاز حدود ۱۶۷۷ (هنوز مقدماتی/Preliminary) و رتبهٔ اول گزارش شده؛ جلوتر از Claude Fable 5 (حدود ۱۶۳۶) و GPT-5.6 Sol (حدود ۱۶۳۳). این همان عددی است که در شبکههای اجتماعی زیاد بازنشر شد، چون «برنده شدن مدل چینیِ در آستانهٔ وزنباز در قلمرو کدنویسی وب» روایت جذابی میسازد.
| مدل | Frontend Code Arena | رتبه |
|---|---|---|
| Kimi K3 | ۱۶۷۷ (مقدماتی) | ۱ |
| Claude Fable 5 | ۱۶۳۶ | ۲ |
| GPT-5.6 Sol | ۱۶۳۳ | ۳ |
شاخص کلی: تا ۲۱ ژوئیهٔ ۲۰۲۶، در Artificial Analysis Intelligence Index امتیاز حدود ۵۷ و رتبهٔ چهارم از میان صدها مدل گزارش شده؛ همسطح تقریبی Opus 4.8 / GPT-5.5 و عقبتر از Fable 5 و GPT-5.6 Sol. هیچ مدل همردهٔ با وزن باز تا این لحظه در این ارتفاع قرار نگرفته بود. این رتبهبندی پویاست و ممکن است تغییر کند.
مونشات همچنین مطالعات موردیِ ایجنتیک بلندی منتشر کرده: بهینهسازی کرنل GPU تا ۲۴ ساعت، ساخت کامپایلر شبیه Triton از صفر، طراحی اثباتمفهومی تراشه برای یک نانومدل، و بازتولید خطلولهٔ پژوهشی اخترفیزیک در حدود دو ساعت. اینها بنچمارک کلاسیک نیستند، اما نشان میدهند تمرکز محصول روی «کار مهندسی طولانیمدت» است نه فقط چت.
مقایسه با غولهای آمریکایی
در برابر Claude Fable 5 و GPT-5.6 Sol: خود مونشات میگوید هنوز در تجربهٔ کلی و برخی بنچمارکهای عمیق عقب است. یعنی روایت «چین آمریکا را نابود کرد» اغراق است؛ روایت دقیقتر این است که فاصلهٔ مدلهای با وزن باز با قلهٔ بسته به باریکترین نقطهٔ تاریخ رسیده است.
در برابر Claude Opus 4.8: پیشبینی FT و بخش بزرگی از جداول کدنویسی نشان میدهد K3 در چند محور کدنویسی و ایجنتیک با Opus رقابت میکند یا جلو میزند، در حالی که Opus همچنان در برخی وظایف عمیقتر یا محصولمحور ممکن است پایدارتر باشد.
تفاوت استراتژیک: OpenAI و Anthropic مدلهای پرچمدار را بسته نگه میدارند و روی حاشیهٔ API شرط میبندند. K3 وعده میدهد وزنها را باز کند؛ یعنی پس از ۲۷ ژوئیه سازمانها میتوانند مدل را روی زیرساخت خود اجرا کنند، fine-tune کنند، و وابستگی به API خارجی را کم کنند — دقیقاً همان ترسی که در هشدار ساتیا نادلا دربارهٔ «پرداخت دوگانه» هم دیده میشود.
قیمت API رسمی Kimi: طبق اعلام پلتفرم، حدود ۰٫۳۰ دلار برای هر میلیون توکن ورودی با cache-hit، ۳ دلار برای ورودی cache-miss، و ۱۵ دلار برای خروجی. در بارهای کدنویسی نرخ برخورد کش بالای ۹۰٪ گزارش شده؛ یعنی هزینهٔ واقعی برای بسیاری از گردشکارها میتواند خیلی پایینتر از قیمت اسمی ورودی باشد.
| نوع توکن | قیمت (هر ۱ میلیون توکن) |
|---|---|
| ورودی با cache-hit | ۰٫۳۰ دلار |
| ورودی با cache-miss | ۳ دلار |
| خروجی | ۱۵ دلار |
واکنش والاستریت و سیلیکونولی
تککرانچ گزارش داد اعلام Kimi همزمان با کنفرانس شانگهای با نگرانی بازار همزمان شد: نزدک حدود ۱٪ افت کرد و سهام تراشهای مثل Nvidia فروش رفت. منطق بخشی از سرمایهگذاران این است که اگر مدلهای چینی با وزن باز «هوش تقریباً frontier» را ارزان کنند، بازگشت سرمایهٔ عظیم آموزش مدلهای بسته و حتی روایت کمیابی GPU زیر سؤال میرود؛ هرچند رابطهٔ علتومعلولی قطعی فقط با یک مدل اثبات نمیشود.
دیوید سکس، مشاور سابق دولت ترامپ در هوش مصنوعی، پیشرفت Kimi را در برابر آمریکا قرار داد که بهگفتهٔ او با ممنوعیت دیتاسنتر، مقررات ایالتی و پیشتأیید مدلهای frontier خودش را در گره انداخته است. تراویس کالانیک هم دوباره بحث distillation (آموزش روی خروجی مدلهای آمریکایی) را پیش کشید — هرچند خود مدلهای آمریکایی هم گاهی روی پایههای چینی ساخته شدهاند.
دین بال، یکی از مدیران OpenAI در حوزهٔ آیندهنگری راهبردی، ابتدا گفت Kimi «مدل خیلی خوبی» است که احتمالاً فقط با distillation توضیح داده نمیشود، و هشدار داد دنیا با سلطهٔ مدلهای با وزن باز ممکن است به سمت «کمونیسم هوش مصنوعی» برود؛ جایی که AI مثل زیرساخت عمومی دولتی دیده شود. او حتی پیشنهاد کرد دولت با «قانون نرم» و ایجاد FUD نظارتی، شرکتهای تحتنظارت را از مدلهای چینی دور کند — موضعی که بعداً تعدیل کرد، اما جرقهٔ بحث بزرگی زد. این واکنش یک مدیر است، نه الزاماً موضع رسمی کل OpenAI.
در گزارش جداگانهٔ تککرانچ، مشخص شد دولت ترامپ به درخواست آزمایشگاههای آمریکایی بررسی ممنوعیت K3 و مدلهای پیشرفتهٔ چینی را روی میز داشته، هرچند وزارت بازرگانی فعلاً چنین اقدامی را نزدیک نمیداند. در مقابل، چهرههایی مثل یان لهکون و مدیران Hugging Face میگویند محدود کردن مدلهای باز نوآوری را خفه میکند و ریسک را پنهان میکند، نه اینکه ایمنی را بالا ببرد.
معنای ژئوپلیتیک: جنگ مدلهای بسته در برابر وزنباز
Kimi K3 فقط یک محصول نیست؛ نماد سیاست صنعتی چین در باز کردن وزن مدلهاست. آمریکا تراشه را محدود میکند؛ چین با معماری کارآمدتر و وعدهٔ انتشار مدل با وزن باز (Open-Weight) پاسخ میدهد. نتیجه برای بازار جهانی این است که نوآوران دانشگاهی و استارتاپها ممکن است بیشتر روی پایههای چینی بسازند — نگرانیای که برخی پژوهشگران آمریکایی صریحاً مطرح کردهاند.
این جدال روی کسبوکار هم اثر دارد: مدل قوی با وزن باز حاشیهٔ سود APIهای frontier را فشار میدهد، قیمت را پایین میآورد، و مصرف کل هوش مصنوعی را بالا میبرد. برندگان میتوانند انویدیا (تقاضای استنتاج پخششده)، هاستینگها، و شرکتهای ابزار باشند؛ بازندههای احتمالی آزمایشگاههایی هستند که فقط روی انحصار مدل شرط بستهاند.
برای توسعهدهنده و شرکت ایرانی چه معنایی دارد؟
۱) جایگزین عملی APIهای گران: اگر کیفیت کدنویسی و ایجنتیک K3 نزدیک پرچمداران بماند، تیمها میتوانند هزینهٔ توکن را با API رسمی مدیریت کنند؛ و پس از انتشار وزنها، در صورت دسترسی به کلاستر بزرگ GPU، گزینهٔ استقرار خصوصی (self-hosted) هم مطرح میشود.
۲) مالکیت داده و حاکمیت: اجرای مدل روی زیرساخت خودتان همان دغدغهای را کم میکند که نادلا دربارهٔ لو رفتن دانش سازمانی به آزمایشگاههای بسته مطرح کرد — البته این کار برای K3 به سرور خانگی یا یک GPU معمولی مربوط نیست؛ مونشات پیکربندیهای بزرگ (دهها شتابدهنده) را توصیه کرده است.
۳) ریسک تحریم و دسترسی: بحث ممنوعیت مدلهای چینی در آمریکا نشان میدهد ریسک ژئوپلیتیک واقعی است. برای تیمهای ایرانی، تنوع مدل (اروپایی، آمریکایی، چینی، با وزن باز) مهمتر از وابستگی به یک برند است.
۴) زمانبندی وزنها: تا انتشار کامل وزنها، دسترسی اصلی از طریق اپ و API کیمی است. بعد از ۲۷ ژوئیه، انتظار موج fine-tune، کوانتیزه، و استقرار روی vLLM و زیرساختهای ابری میرود — به شرطی که لایسنس و جزئیات انتشار واقعاً اجازهٔ استفادهٔ گسترده بدهد.
محدودیتهایی که مونشات خودش اعتراف کرده
K3 به تاریخچهٔ thinking حساس است؛ اگر harness فکر قبلی را کامل برنگرداند، کیفیت ناپایدار میشود. ممکن است بیشازحد پیشدستانه عمل کند و بدون مرز روشن تصمیم بگیرد. و با وجود رقابتپذیری بالا، هنوز در تجربهٔ کاربری کلی از Fable 5 و GPT-5.6 Sol عقب است. این اعترافها مهماند، چون روایت هیجانی شبکههای اجتماعی معمولاً آنها را حذف میکند.
جمعبندی
Kimi K3 نقطهٔ عطفی در رقابت مدلهای بسته با مدلهای در آستانهٔ وزنباز است: مقیاس ۲٫۸ تریلیون پارامتر، بافت ۱ میلیون توکن، بنچمارکهای کدنویسی نزدیک قله، واکنش بازار، و بحث داغ در واشنگتن و سیلیکونولی. این به معنای «پایان OpenAI و Anthropic» نیست؛ به معنای پایان دوران اطمینان از اینکه قلهٔ هوش مصنوعی فقط پشت دیوار APIهای آمریکایی میماند هست.
برای مخاطب فارسی، پیام روشن است: آیندهٔ ابزارهای هوش مصنوعی ارزانتر، بازتر، و ژئوپلیتیکتر میشود. کسانی که فقط مصرفکنندهٔ یک چتبات بسته بمانند، از موج بعدی زیرساخت با وزن باز عقب میافتند؛ کسانی که معماری، هزینه، و ریسک را بفهمند، برندهاند.



