در کمتر از یک هفته، نام Kimi K3 از یک شایعهٔ فایننشال‌تایمز به یکی از داغ‌ترین بحث‌های سیلیکون‌ولی تبدیل شد. شرکت چینی Moonshot AI مدلی با حدود ۲٫۸ تریلیون پارامتر معرفی کرد که خودش آن را «اولین مدل کلاس ۳ تریلیون پارامتر که قرار است با وزن‌های باز منتشر شود» می‌نامد (وزن‌ها هنوز منتشر نشده و انتشارشان برای ۲۷ ژوئیه وعده داده شده است)؛ مدلی با پنجرهٔ بافت ۱ میلیون توکن، معماری Mixture of Experts، قابلیت بینایی بومی، و وعدهٔ انتشار وزن‌های کامل تا ۲۷ ژوئیهٔ ۲۰۲۶. تا آن تاریخ، دسترسی اصلی از طریق اپ و API رسمی است — نه دانلود آزاد وزن‌ها.

این خبر فقط یک آپدیت فنی نیست. هم‌زمان با سخنرانی شی جین‌پینگ در کنفرانس جهانی هوش مصنوعی شانگهای، نزدک حدود ۱٪ افت کرد و سهام تراشه‌سازانی مثل انویدیا زیر فشار فروش رفت؛ تک‌کرانچ این هم‌زمانی را محتاطانه با نگرانی بازار از مدل‌های چینی مرتبط دانسته است. بحث قدیمی پس از شوک DeepSeek دوباره زنده شد — فقط این‌بار با جنگ تعرفه‌ای، دغدغهٔ امنیت ملی، و حساسیت آزمایشگاه‌های آمریکایی نسبت به مدل‌های با وزن باز (Open-Weight) تندتر شده است.

در این گزارش جامع، از مشخصات فنی و بنچمارک‌ها تا مقایسه با OpenAI و Anthropic، واکنش وال‌استریت، جدال ژئوپلیتیک، و معنای عملی برای توسعه‌دهندگان فارسی‌زبان را بررسی می‌کنیم.

Kimi K3 چیست و چرا تا این حد سروصدا کرده است؟

Kimi K3 پرچم‌دار جدید Moonshot AI است که ۱۶ ژوئیهٔ ۲۰۲۶ روی kimi.com، Kimi Work، Kimi Code و API رسمی در دسترس قرار گرفت. طبق بلاگ فنی خود شرکت:

۲٫۸ تریلیون پارامتر کل · معماری Mixture of Experts (MoE) با فعال‌سازی ۱۶ از ۸۹۶ کارشناس · پنجرهٔ بافت ۱ میلیون توکن · ورودی متن و تصویر (بینایی بومی)؛ پشتیبانی از ویدئو در برخی ابزارهای Kimi · الگوریتم‌های Kimi Delta Attention (KDA) و Attention Residuals · انتشار وزن‌های کامل تا ۲۷ ژوئیهٔ ۲۰۲۶.

نکتهٔ کلیدی برای درک هیاهو این است: مون‌شات صراحتاً می‌گوید عملکرد کلی K3 هنوز از قوی‌ترین مدل‌های اختصاصی یعنی Claude Fable 5 و GPT-5.6 Sol عقب است؛ اما در مجموعهٔ ارزیابی‌هایش عملکرد سطح frontier داشته و از مدل‌های هم‌ردهٔ بازتر جلو زده است. تحلیل‌های مستقل Arena.ai و Vals AI هم نشانه‌هایی از رقابت‌پذیری آن با پرچم‌داران frontier نشان داده‌اند.

پیش از عرضه، فایننشال‌تایمز به نقل از منابع ناشناس نوشته بود Kimi K3 فاصله با Claude Opus 4.8 را کم می‌کند یا حتی از آن جلو می‌زند، بین ۲ تا ۳ تریلیون پارامتر دارد، و مون‌شات در حال جذب سرمایه با ارزش‌گذاری حدود ۳۱٫۵ میلیارد دلار است (پس از جذب ۲ میلیارد دلار در مه با ارزش‌گذاری ۲۰ میلیارد).

بررسی عمیق فنی: چین چطور با معماری نرم‌افزاری جلو آمد؟

محدودیت صادرات تراشه‌های پیشرفتهٔ انویدیا به چین یکی از محورهای رقابت آمریکا–چین بوده است. پاسخ مون‌شات در K3 بیشتر معماری و بهره‌وری است تا صرفاً خرید GPU بیشتر.

۱) Mixture of Experts پویا: ۲٫۸ تریلیون، اما نه همه با هم

در MoE، مدل به کارشناس‌های تخصصی تقسیم می‌شود و برای هر توکن فقط بخشی روشن می‌شود. در K3 با چارچوب Stable LatentMoE، از ۸۹۶ کارشناس فقط ۱۶ تا فعال می‌شوند. نتیجه: مقیاس پارامتری عظیم با هزینهٔ استنتاج قابل‌کنترل‌تر نسبت به فعال‌کردن تمام پارامترها. مون‌شات می‌گوید این تغییرات به همراه دستور پخت آموزش، حدود ۲٫۵ برابر بهبود بهره‌وری مقیاس نسبت به Kimi K2 ایجاد کرده است.

۲) Kimi Delta Attention و Attention Residuals

KDA یک مکانیزم توجه هیبریدی/خطی است که برای نگه‌داشتن جریان اطلاعات در توالی‌های خیلی بلند طراحی شده؛ مون‌شات ادعا می‌کند در بافت‌های میلیون‌توکنی تا حدود ۶٫۳ برابر رمزگشایی سریع‌تر ممکن است. AttnRes هم نحوهٔ عبور اطلاعات در عمق شبکه را عوض می‌کند؛ طبق گزارش‌های تیم Kimi، آزمایش‌های scaling مزیت محاسباتی حدود ۱٫۲۵ برابر را نشان داده‌اند و سربار تأخیر استنتاج در بارهای معمول کمتر از ۲٪ گزارش شده است. این‌ها فعلاً ادعا و نتایج خود تیم هستند، نه تأیید مستقل کامل روی نسخهٔ نهایی.

۳) پنجرهٔ بافت ۱ میلیون توکن

یک میلیون توکن یعنی امکان نگه داشتن حجم بسیار بیشتری از کد، اسناد، یا تاریخچهٔ یک نشست ایجنت چندساعته در یک زمینه. این قابلیت برای کدنویسی ایجنتیک و پژوهش مفید است، اما پنجرهٔ بزرگ به‌تنهایی تضمین نمی‌کند مدل همهٔ جزئیات را دقیق به خاطر بسپارد.

۴) کوانتیزیشن و استقرار

از مرحلهٔ SFT به بعد آموزش آگاه‌از‌کوانتیزیشن با وزن‌های MXFP4 و فعال‌سازی MXFP8 گزارش شده تا سازگاری سخت‌افزاری گسترده شود. مون‌شات برای استنتاج در مقیاس بزرگ، پیکربندی‌های ابرگره با ۶۴ شتاب‌دهنده یا بیشتر را توصیه می‌کند و پیاده‌سازی مرتبط با کش پیشوند KDA را به جامعهٔ vLLM وعده داده است.

بنچمارک‌ها: کجا می‌برد، کجا عقب می‌ماند؟

اعداد زیر خلاصه‌ای از گزارش‌های بلاگ رسمی و جمع‌بندی‌های مستقل است. ارزیابی‌ها عمدتاً در بالاترین سطح استدلال انجام شده‌اند، اما harness (مثل KimiCode، Claude Code، Codex)، سخت‌افزار و روش اجرا یکسان نبوده؛ بنابراین این مقایسه تقریبی است، نه آزمایش کاملاً کنترل‌شده.

کدنویسی: در Program Bench حدود ۷۷٫۸ (بالاتر از Fable 5 و GPT-5.6 Sol در همان جدول) · در SWE Marathon حدود ۴۲٫۰ (بالاترین در جدول گزارش‌شده) · در Terminal-Bench 2.1 حدود ۸۸٫۳ (نزدیک به ۸۸٫۸ سول) · در FrontierSWE حدود ۸۱٫۲ (دوم بعد از Fable 5) · در DeepSWE حدود ۶۷٫۳ (عقب‌تر از Sol و Fable).

فرانت‌اند و ترجیح انسانی: در Frontend Code Arena امتیاز حدود ۱۶۷۷ (هنوز مقدماتی/Preliminary) و رتبهٔ اول گزارش شده؛ جلوتر از Claude Fable 5 (حدود ۱۶۳۶) و GPT-5.6 Sol (حدود ۱۶۳۳). این همان عددی است که در شبکه‌های اجتماعی زیاد بازنشر شد، چون «برنده شدن مدل چینیِ در آستانهٔ وزن‌باز در قلمرو کدنویسی وب» روایت جذابی می‌سازد.

مدلFrontend Code Arenaرتبه
Kimi K3۱۶۷۷ (مقدماتی)۱
Claude Fable 5۱۶۳۶۲
GPT-5.6 Sol۱۶۳۳۳

شاخص کلی: تا ۲۱ ژوئیهٔ ۲۰۲۶، در Artificial Analysis Intelligence Index امتیاز حدود ۵۷ و رتبهٔ چهارم از میان صدها مدل گزارش شده؛ هم‌سطح تقریبی Opus 4.8 / GPT-5.5 و عقب‌تر از Fable 5 و GPT-5.6 Sol. هیچ مدل هم‌ردهٔ با وزن باز تا این لحظه در این ارتفاع قرار نگرفته بود. این رتبه‌بندی پویاست و ممکن است تغییر کند.

مون‌شات همچنین مطالعات موردیِ ایجنتیک بلندی منتشر کرده: بهینه‌سازی کرنل GPU تا ۲۴ ساعت، ساخت کامپایلر شبیه Triton از صفر، طراحی اثبات‌مفهومی تراشه برای یک نانومدل، و بازتولید خط‌لولهٔ پژوهشی اخترفیزیک در حدود دو ساعت. این‌ها بنچمارک کلاسیک نیستند، اما نشان می‌دهند تمرکز محصول روی «کار مهندسی طولانی‌مدت» است نه فقط چت.

مقایسه با غول‌های آمریکایی

در برابر Claude Fable 5 و GPT-5.6 Sol: خود مون‌شات می‌گوید هنوز در تجربهٔ کلی و برخی بنچمارک‌های عمیق عقب است. یعنی روایت «چین آمریکا را نابود کرد» اغراق است؛ روایت دقیق‌تر این است که فاصلهٔ مدل‌های با وزن باز با قلهٔ بسته به باریک‌ترین نقطهٔ تاریخ رسیده است.

در برابر Claude Opus 4.8: پیش‌بینی FT و بخش بزرگی از جداول کدنویسی نشان می‌دهد K3 در چند محور کدنویسی و ایجنتیک با Opus رقابت می‌کند یا جلو می‌زند، در حالی که Opus همچنان در برخی وظایف عمیق‌تر یا محصول‌محور ممکن است پایدارتر باشد.

تفاوت استراتژیک: OpenAI و Anthropic مدل‌های پرچم‌دار را بسته نگه می‌دارند و روی حاشیهٔ API شرط می‌بندند. K3 وعده می‌دهد وزن‌ها را باز کند؛ یعنی پس از ۲۷ ژوئیه سازمان‌ها می‌توانند مدل را روی زیرساخت خود اجرا کنند، fine-tune کنند، و وابستگی به API خارجی را کم کنند — دقیقاً همان ترسی که در هشدار ساتیا نادلا دربارهٔ «پرداخت دوگانه» هم دیده می‌شود.

قیمت API رسمی Kimi: طبق اعلام پلتفرم، حدود ۰٫۳۰ دلار برای هر میلیون توکن ورودی با cache-hit، ۳ دلار برای ورودی cache-miss، و ۱۵ دلار برای خروجی. در بارهای کدنویسی نرخ برخورد کش بالای ۹۰٪ گزارش شده؛ یعنی هزینهٔ واقعی برای بسیاری از گردش‌کارها می‌تواند خیلی پایین‌تر از قیمت اسمی ورودی باشد.

نوع توکنقیمت (هر ۱ میلیون توکن)
ورودی با cache-hit۰٫۳۰ دلار
ورودی با cache-miss۳ دلار
خروجی۱۵ دلار

واکنش وال‌استریت و سیلیکون‌ولی

تک‌کرانچ گزارش داد اعلام Kimi هم‌زمان با کنفرانس شانگهای با نگرانی بازار هم‌زمان شد: نزدک حدود ۱٪ افت کرد و سهام تراشه‌ای مثل Nvidia فروش رفت. منطق بخشی از سرمایه‌گذاران این است که اگر مدل‌های چینی با وزن باز «هوش تقریباً frontier» را ارزان کنند، بازگشت سرمایهٔ عظیم آموزش مدل‌های بسته و حتی روایت کمیابی GPU زیر سؤال می‌رود؛ هرچند رابطهٔ علت‌ومعلولی قطعی فقط با یک مدل اثبات نمی‌شود.

دیوید سکس، مشاور سابق دولت ترامپ در هوش مصنوعی، پیشرفت Kimi را در برابر آمریکا قرار داد که به‌گفتهٔ او با ممنوعیت دیتاسنتر، مقررات ایالتی و پیش‌تأیید مدل‌های frontier خودش را در گره انداخته است. تراویس کالانیک هم دوباره بحث distillation (آموزش روی خروجی مدل‌های آمریکایی) را پیش کشید — هرچند خود مدل‌های آمریکایی هم گاهی روی پایه‌های چینی ساخته شده‌اند.

دین بال، یکی از مدیران OpenAI در حوزهٔ آینده‌نگری راهبردی، ابتدا گفت Kimi «مدل خیلی خوبی» است که احتمالاً فقط با distillation توضیح داده نمی‌شود، و هشدار داد دنیا با سلطهٔ مدل‌های با وزن باز ممکن است به سمت «کمونیسم هوش مصنوعی» برود؛ جایی که AI مثل زیرساخت عمومی دولتی دیده شود. او حتی پیشنهاد کرد دولت با «قانون نرم» و ایجاد FUD نظارتی، شرکت‌های تحت‌نظارت را از مدل‌های چینی دور کند — موضعی که بعداً تعدیل کرد، اما جرقهٔ بحث بزرگی زد. این واکنش یک مدیر است، نه الزاماً موضع رسمی کل OpenAI.

در گزارش جداگانهٔ تک‌کرانچ، مشخص شد دولت ترامپ به درخواست آزمایشگاه‌های آمریکایی بررسی ممنوعیت K3 و مدل‌های پیشرفتهٔ چینی را روی میز داشته، هرچند وزارت بازرگانی فعلاً چنین اقدامی را نزدیک نمی‌داند. در مقابل، چهره‌هایی مثل یان له‌کون و مدیران Hugging Face می‌گویند محدود کردن مدل‌های باز نوآوری را خفه می‌کند و ریسک را پنهان می‌کند، نه اینکه ایمنی را بالا ببرد.

معنای ژئوپلیتیک: جنگ مدل‌های بسته در برابر وزن‌باز

Kimi K3 فقط یک محصول نیست؛ نماد سیاست صنعتی چین در باز کردن وزن مدل‌هاست. آمریکا تراشه را محدود می‌کند؛ چین با معماری کارآمدتر و وعدهٔ انتشار مدل با وزن باز (Open-Weight) پاسخ می‌دهد. نتیجه برای بازار جهانی این است که نوآوران دانشگاهی و استارتاپ‌ها ممکن است بیشتر روی پایه‌های چینی بسازند — نگرانی‌ای که برخی پژوهشگران آمریکایی صریحاً مطرح کرده‌اند.

این جدال روی کسب‌وکار هم اثر دارد: مدل قوی با وزن باز حاشیهٔ سود APIهای frontier را فشار می‌دهد، قیمت را پایین می‌آورد، و مصرف کل هوش مصنوعی را بالا می‌برد. برندگان می‌توانند انویدیا (تقاضای استنتاج پخش‌شده)، هاستینگ‌ها، و شرکت‌های ابزار باشند؛ بازنده‌های احتمالی آزمایشگاه‌هایی هستند که فقط روی انحصار مدل شرط بسته‌اند.

برای توسعه‌دهنده و شرکت ایرانی چه معنایی دارد؟

۱) جایگزین عملی APIهای گران: اگر کیفیت کدنویسی و ایجنتیک K3 نزدیک پرچم‌داران بماند، تیم‌ها می‌توانند هزینهٔ توکن را با API رسمی مدیریت کنند؛ و پس از انتشار وزن‌ها، در صورت دسترسی به کلاستر بزرگ GPU، گزینهٔ استقرار خصوصی (self-hosted) هم مطرح می‌شود.

۲) مالکیت داده و حاکمیت: اجرای مدل روی زیرساخت خودتان همان دغدغه‌ای را کم می‌کند که نادلا دربارهٔ لو رفتن دانش سازمانی به آزمایشگاه‌های بسته مطرح کرد — البته این کار برای K3 به سرور خانگی یا یک GPU معمولی مربوط نیست؛ مون‌شات پیکربندی‌های بزرگ (ده‌ها شتاب‌دهنده) را توصیه کرده است.

۳) ریسک تحریم و دسترسی: بحث ممنوعیت مدل‌های چینی در آمریکا نشان می‌دهد ریسک ژئوپلیتیک واقعی است. برای تیم‌های ایرانی، تنوع مدل (اروپایی، آمریکایی، چینی، با وزن باز) مهم‌تر از وابستگی به یک برند است.

۴) زمان‌بندی وزن‌ها: تا انتشار کامل وزن‌ها، دسترسی اصلی از طریق اپ و API کیمی است. بعد از ۲۷ ژوئیه، انتظار موج fine-tune، کوانتیزه، و استقرار روی vLLM و زیرساخت‌های ابری می‌رود — به شرطی که لایسنس و جزئیات انتشار واقعاً اجازهٔ استفادهٔ گسترده بدهد.

محدودیت‌هایی که مون‌شات خودش اعتراف کرده

K3 به تاریخچهٔ thinking حساس است؛ اگر harness فکر قبلی را کامل برنگرداند، کیفیت ناپایدار می‌شود. ممکن است بیش‌ازحد پیش‌دستانه عمل کند و بدون مرز روشن تصمیم بگیرد. و با وجود رقابت‌پذیری بالا، هنوز در تجربهٔ کاربری کلی از Fable 5 و GPT-5.6 Sol عقب است. این اعتراف‌ها مهم‌اند، چون روایت هیجانی شبکه‌های اجتماعی معمولاً آن‌ها را حذف می‌کند.

جمع‌بندی

Kimi K3 نقطهٔ عطفی در رقابت مدل‌های بسته با مدل‌های در آستانهٔ وزن‌باز است: مقیاس ۲٫۸ تریلیون پارامتر، بافت ۱ میلیون توکن، بنچمارک‌های کدنویسی نزدیک قله، واکنش بازار، و بحث داغ در واشنگتن و سیلیکون‌ولی. این به معنای «پایان OpenAI و Anthropic» نیست؛ به معنای پایان دوران اطمینان از اینکه قلهٔ هوش مصنوعی فقط پشت دیوار APIهای آمریکایی می‌ماند هست.

برای مخاطب فارسی، پیام روشن است: آیندهٔ ابزارهای هوش مصنوعی ارزان‌تر، بازتر، و ژئوپلیتیک‌تر می‌شود. کسانی که فقط مصرف‌کنندهٔ یک چت‌بات بسته بمانند، از موج بعدی زیرساخت با وزن باز عقب می‌افتند؛ کسانی که معماری، هزینه، و ریسک را بفهمند، برنده‌اند.