Anthropic مدل جدیدش، Claude Opus 5، را عرضه کرد؛ مدلی که بهگفتهٔ این شرکت «متفکر و پیشدستانه» است و با حدود نیمی از هزینه به هوش پرچمدار یعنی Claude Fable 5 نزدیک میشود.
بهگفتهٔ Anthropic، در ارزیابیهای کدنویسی و کار دانشی مثل Frontier-Bench و GDPval-AA، مدل Opus 5 رکورد تازهای میزند؛ هرچند در وظایف امنیت سایبری همچنان پشت مدل Mythos 5 قرار دارد. Opus 5 برای استفادهٔ روزمره طراحی شده، حالا مدل پیشفرض در Claude Max و قویترین مدل در Claude Pro است.
عملکرد و صرفهٔ هزینه
Anthropic میگوید Opus 5 با همان هزینهٔ نسل قبلی (Opus 4.8) عملکرد بهمراتب بهتری میدهد. نمودارهای زیر نشان میدهند عملکرد چطور با «سطح تلاش» مدل تغییر میکند؛ تنظیمی که مشتری میتواند با آن بین هوش بیشتر یا مصرف توکن کمتر تعادل برقرار کند.
برای نمونه، در Frontier-Bench v0.1 مدل Opus 5 از همهٔ مدلهای دیگر جلو میزند و با هزینهٔ کمتر بهازای هر وظیفه، بیش از دو برابر Opus 4.8 امتیاز میگیرد. در CursorBench 3.2 هم در بالاترین سطح تلاش تا فاصلهٔ کمتر از ۰٫۵٪ با بهترین امتیاز Fable 5 میرسد، اما با نصف هزینه بهازای هر وظیفه.


کار دانشی، حل مسئله و استفاده از کامپیوتر
روی وظایف دانشی و حل مسئله هم نتیجه مشابه است. در ARC-AGI 3 که مدل باید مسائل کاملاً تازه را حل کند، امتیاز Opus 5 حدود سه برابر بهترین مدل بعدی است. در Zapier AutomationBench که سنجش انجام کارهای واقعی کسبوکار از صفر تا صد است، نرخ موفقیت Opus 5 با همان هزینه حدود ۱٫۵ برابر بهترین رقیب است. در OSWorld 2.0 (استفادهٔ ایجنت از کامپیوتر) هم در هر سطح هزینه از بقیه بهتر عمل میکند و با حدود یکسوم هزینه از بهترین نتیجهٔ Fable 5 جلو میزند.




جدول جمعبندی بنچمارکها
جدول رسمی Anthropic، Opus 5 را در کنار Fable 5، Opus 4.8 و GPT-5.6 Sol میگذارد. Opus 5 در کدنویسی ترمینال (Frontier-Bench)، کار دانشی (GDPval-AA)، حل مسئلهٔ نو (ARC-AGI-3)، استفاده از کامپیوتر و گردشکار کسبوکار بهترین است؛ اما در چند مورد مثل DeepSWE (که GPT-5.6 Sol جلوتر است) یا کدنویسی FrontierCode (که Fable 5 اندکی بالاتر است) صدرنشین نیست.

پژوهش علمی و خروجیهای بصری
بهگفتهٔ Anthropic، Opus 5 در همهٔ ارزیابیهای علوم زیستی از Opus 4.8 بهتر است؛ بیشترین پیشرفت در شیمی آلی (مثلاً استنتاج ساختار مولکولی از دادهٔ طیفسنجی، حدود ۱۰٫۲ واحد درصد بالاتر) و در کارهای پروتئینی (پیشبینی اثر تغییر توالی پروتئین بر عملکرد، حدود ۷٫۷ واحد درصد بالاتر) بوده است. این مدل خروجیهای بصری قویتری هم میسازد؛ از جمله شبیهسازی تعاملی جریان هوا در «تونل باد» و یک تصویر تعاملی سادهشده از یک سلول.
همراستایی و ایمنی
Anthropic میگوید در آزمونهای پیش از انتشار، ممیزی رفتاری خودکارش نشان داده Opus 5 همراستاترین مدل تاریخ این شرکت است: بهتر از Opus 4.8، Sonnet 5 و Fable 5 به «قانون اساسی Claude» پایبند میماند، کمترین نرخ رفتار فریبکارانه را دارد و سختتر از بقیه فریب میخورد. در ممیزی رفتاری خودکار، امتیاز رفتار ناهمراستای کلی آن ۲٫۳ است؛ کمترین مقدار در میان مدلهای اخیر.

امنیت سایبری و زیستشناسی
در حوزهٔ خطرناک و دومنظوره، Opus 5 مرز را جلو نمیبرد. در ارزیابیهای مشترک با شرکای دولتی و خصوصی، این مدل هم در پژوهش زیستی و هم در امنیت سایبری تهاجمی پشت Mythos 5 میماند. مثل نسل قبل، Anthropic عمداً Opus 5 را روی وظایف سایبری آموزش نداده، اما مدل بهخاطر توانمندتر شدن کلی، در همین کارها هم پیشرفت چشمگیری کرده است.
نمونهٔ روشن، ارزیابی OSS-Fuzz است: Opus 5 در یافتن آسیبپذیریهای نرمافزاری تقریباً همسطح Mythos 5 است، اما در ساخت اکسپلویت برای همان آسیبپذیریها (یعنی تبدیلشان به تهدید واقعی) هنوز خیلی عقبتر است.

محافظها (Safeguards)
محافظهای Opus 5 شبیه Opus 4.8 است، با کمی سختگیری بیشتر روی دامنهٔ باریکی از کارهای سایبری. طبقهبندیکنندههای سایبری این مدل نسبت به Fable 5 آسانگیرترند: یافتن آسیبپذیری در کد منبع را اجازه میدهند، اما اسکن آسیبپذیری «مبتنی بر باینری»، تست نفوذ و تولید اکسپلویت را مسدود میکنند. Anthropic تخمین میزند این طبقهبندیکنندهها حدود ۸۵٪ کمتر از Fable 5 دخالت کنند و درخواستهای علامتخورده بهطور پیشفرض به Opus 4.8 برگردانده میشوند. شرکتها و پژوهشگران عضو «برنامهٔ راستیآزمایی سایبری» (CVP) به نسخهای با محدودیت کمتر دسترسی دارند. در زیستشناسی هم درخواستهایی که روی Fable 5 مسدود میشدند، حالا بهجای Opus 4.8 به Opus 5 هدایت میشوند.
قیمت و نحوهٔ دسترسی
Claude Opus 5 از همین امروز روی همهٔ پلتفرمها در دسترس است؛ با قیمت ۵ دلار بهازای هر میلیون توکن ورودی و ۲۵ دلار بهازای هر میلیون توکن خروجی (برابر با Opus 4.8). توسعهدهندگان میتوانند با شناسهٔ claude-opus-5 در Claude API شروع کنند. یک حالت «Fast» هم هست که حدود ۲٫۵ برابر سریعتر اجرا میشود و روی پلتفرم Claude دو برابر قیمت پایه هزینه دارد.
همراه این عرضه، دو قابلیت هم در نسخهٔ بتا آمده: تغییر ابزارها در میانهٔ گفتوگو روی پلتفرم Claude بدون باطلشدن کش پرامپت، و بازگشت خودکار (fallback) در API که درخواستهای علامتخورده بهجای مسدودشدن، به بهترین مدل در دسترس هدایت میشوند.
جمعبندی
روایت Anthropic از Opus 5 روشن است: هوشی نزدیک به قلهٔ Fable 5 با حدود نیمی از هزینه، رکورد در کدنویسی و کار دانشی، و ادعای بالاترین همراستایی. در مقابل، این مدل عمداً در امنیت سایبری تهاجمی و پژوهش زیستی مرزشکنی نکرده و در این حوزهها پشت Mythos 5 مانده است. برای مخاطب فارسی، پیام عملی این است که رقابت مدلهای پرچمدار حالا بیشتر بر سر «هوش بیشتر بهازای هر دلار» است تا صرفاً بالاترین امتیاز خام.



