Anthropic مدل جدیدش، Claude Opus 5، را عرضه کرد؛ مدلی که به‌گفتهٔ این شرکت «متفکر و پیش‌دستانه» است و با حدود نیمی از هزینه به هوش پرچم‌دار یعنی Claude Fable 5 نزدیک می‌شود.

به‌گفتهٔ Anthropic، در ارزیابی‌های کدنویسی و کار دانشی مثل Frontier-Bench و GDPval-AA، مدل Opus 5 رکورد تازه‌ای می‌زند؛ هرچند در وظایف امنیت سایبری همچنان پشت مدل Mythos 5 قرار دارد. Opus 5 برای استفادهٔ روزمره طراحی شده، حالا مدل پیش‌فرض در Claude Max و قوی‌ترین مدل در Claude Pro است.

عملکرد و صرفهٔ هزینه

Anthropic می‌گوید Opus 5 با همان هزینهٔ نسل قبلی (Opus 4.8) عملکرد به‌مراتب بهتری می‌دهد. نمودارهای زیر نشان می‌دهند عملکرد چطور با «سطح تلاش» مدل تغییر می‌کند؛ تنظیمی که مشتری می‌تواند با آن بین هوش بیشتر یا مصرف توکن کمتر تعادل برقرار کند.

برای نمونه، در Frontier-Bench v0.1 مدل Opus 5 از همهٔ مدل‌های دیگر جلو می‌زند و با هزینهٔ کمتر به‌ازای هر وظیفه، بیش از دو برابر Opus 4.8 امتیاز می‌گیرد. در CursorBench 3.2 هم در بالاترین سطح تلاش تا فاصلهٔ کمتر از ۰٫۵٪ با بهترین امتیاز Fable 5 می‌رسد، اما با نصف هزینه به‌ازای هر وظیفه.

نمودار Frontier-Bench v0.1: امتیاز کدنویسی ایجنتیک در برابر هزینه به‌ازای هر تلاش
کدنویسی ایجنتیک بر حسب سطح تلاش (Frontier-Bench v0.1)؛ Opus 5 با هزینهٔ کمتر بالاتر از بقیه. منبع: Anthropic
نمودار CursorBench: امتیاز در برابر هزینه به‌ازای هر وظیفه
کدنویسی ایجنتیک در CursorBench؛ Opus 5 نزدیک به قلهٔ Fable 5 اما ارزان‌تر. منبع: Anthropic

کار دانشی، حل مسئله و استفاده از کامپیوتر

روی وظایف دانشی و حل مسئله هم نتیجه مشابه است. در ARC-AGI 3 که مدل باید مسائل کاملاً تازه را حل کند، امتیاز Opus 5 حدود سه برابر بهترین مدل بعدی است. در Zapier AutomationBench که سنجش انجام کارهای واقعی کسب‌وکار از صفر تا صد است، نرخ موفقیت Opus 5 با همان هزینه حدود ۱٫۵ برابر بهترین رقیب است. در OSWorld 2.0 (استفادهٔ ایجنت از کامپیوتر) هم در هر سطح هزینه از بقیه بهتر عمل می‌کند و با حدود یک‌سوم هزینه از بهترین نتیجهٔ Fable 5 جلو می‌زند.

نمودار ARC-AGI-3: امتیاز حل مسئلهٔ نو در برابر هزینه
حل مسئلهٔ نو (ARC-AGI-3)؛ Opus 5 با حدود ۳۰٪ فاصلهٔ زیادی با بقیه دارد. منبع: Anthropic
نمودار GDPval-AA v2: امتیاز Elo کار دانشی واقعی در برابر هزینه
کار دانشی واقعی (GDPval-AA v2)؛ Opus 5 در صدر جدول. منبع: Anthropic
نمودار OSWorld 2.0: عملکرد استفاده از کامپیوتر در برابر هزینه
استفادهٔ ایجنتیک از کامپیوتر (OSWorld 2.0). منبع: Anthropic
نمودار AutomationBench: نرخ موفقیت گردش‌کارهای کسب‌وکار در برابر هزینه
گردش‌کارهای کسب‌وکار (Zapier AutomationBench)؛ Opus 5 حتی در کمترین تلاش از بقیه جلوتر است. منبع: Anthropic

جدول جمع‌بندی بنچمارک‌ها

جدول رسمی Anthropic، Opus 5 را در کنار Fable 5، Opus 4.8 و GPT-5.6 Sol می‌گذارد. Opus 5 در کدنویسی ترمینال (Frontier-Bench)، کار دانشی (GDPval-AA)، حل مسئلهٔ نو (ARC-AGI-3)، استفاده از کامپیوتر و گردش‌کار کسب‌وکار بهترین است؛ اما در چند مورد مثل DeepSWE (که GPT-5.6 Sol جلوتر است) یا کدنویسی FrontierCode (که Fable 5 اندکی بالاتر است) صدرنشین نیست.

جدول مقایسهٔ بنچمارک‌های Opus 5 با Fable 5، Opus 4.8 و GPT-5.6 Sol
جدول جمع‌بندی بنچمارک‌ها؛ ستون Opus 5 در بیشتر ردیف‌ها پررنگ است. منبع: Anthropic

پژوهش علمی و خروجی‌های بصری

به‌گفتهٔ Anthropic، Opus 5 در همهٔ ارزیابی‌های علوم زیستی از Opus 4.8 بهتر است؛ بیشترین پیشرفت در شیمی آلی (مثلاً استنتاج ساختار مولکولی از دادهٔ طیف‌سنجی، حدود ۱۰٫۲ واحد درصد بالاتر) و در کارهای پروتئینی (پیش‌بینی اثر تغییر توالی پروتئین بر عملکرد، حدود ۷٫۷ واحد درصد بالاتر) بوده است. این مدل خروجی‌های بصری قوی‌تری هم می‌سازد؛ از جمله شبیه‌سازی تعاملی جریان هوا در «تونل باد» و یک تصویر تعاملی ساده‌شده از یک سلول.

همراستایی و ایمنی

Anthropic می‌گوید در آزمون‌های پیش از انتشار، ممیزی رفتاری خودکارش نشان داده Opus 5 همراستاترین مدل تاریخ این شرکت است: بهتر از Opus 4.8، Sonnet 5 و Fable 5 به «قانون اساسی Claude» پایبند می‌ماند، کمترین نرخ رفتار فریب‌کارانه را دارد و سخت‌تر از بقیه فریب می‌خورد. در ممیزی رفتاری خودکار، امتیاز رفتار ناهمراستای کلی آن ۲٫۳ است؛ کمترین مقدار در میان مدل‌های اخیر.

نمودار رفتار ناهمراستا در ممیزی رفتاری خودکار؛ Opus 5 پایین‌ترین امتیاز
رفتار ناهمراستا (کمتر = بهتر)؛ Opus 5 با امتیاز ۲٫۳۰ پایین‌ترین است. منبع: Anthropic

امنیت سایبری و زیست‌شناسی

در حوزهٔ خطرناک و دومنظوره، Opus 5 مرز را جلو نمی‌برد. در ارزیابی‌های مشترک با شرکای دولتی و خصوصی، این مدل هم در پژوهش زیستی و هم در امنیت سایبری تهاجمی پشت Mythos 5 می‌ماند. مثل نسل قبل، Anthropic عمداً Opus 5 را روی وظایف سایبری آموزش نداده، اما مدل به‌خاطر توانمندتر شدن کلی، در همین کارها هم پیشرفت چشمگیری کرده است.

نمونهٔ روشن، ارزیابی OSS-Fuzz است: Opus 5 در یافتن آسیب‌پذیری‌های نرم‌افزاری تقریباً هم‌سطح Mythos 5 است، اما در ساخت اکسپلویت برای همان آسیب‌پذیری‌ها (یعنی تبدیل‌شان به تهدید واقعی) هنوز خیلی عقب‌تر است.

نمودار OSS-Fuzz: شناسایی آسیب‌پذیری در برابر موفقیت در ساخت اکسپلویت
OSS-Fuzz؛ چپ: شناسایی آسیب‌پذیری (نزدیک Mythos 5)، راست: ساخت اکسپلویت (بسیار عقب‌تر). منبع: Anthropic

محافظ‌ها (Safeguards)

محافظ‌های Opus 5 شبیه Opus 4.8 است، با کمی سخت‌گیری بیشتر روی دامنهٔ باریکی از کارهای سایبری. طبقه‌بندی‌کننده‌های سایبری این مدل نسبت به Fable 5 آسان‌گیرترند: یافتن آسیب‌پذیری در کد منبع را اجازه می‌دهند، اما اسکن آسیب‌پذیری «مبتنی بر باینری»، تست نفوذ و تولید اکسپلویت را مسدود می‌کنند. Anthropic تخمین می‌زند این طبقه‌بندی‌کننده‌ها حدود ۸۵٪ کمتر از Fable 5 دخالت کنند و درخواست‌های علامت‌خورده به‌طور پیش‌فرض به Opus 4.8 برگردانده می‌شوند. شرکت‌ها و پژوهشگران عضو «برنامهٔ راستی‌آزمایی سایبری» (CVP) به نسخه‌ای با محدودیت کمتر دسترسی دارند. در زیست‌شناسی هم درخواست‌هایی که روی Fable 5 مسدود می‌شدند، حالا به‌جای Opus 4.8 به Opus 5 هدایت می‌شوند.

قیمت و نحوهٔ دسترسی

Claude Opus 5 از همین امروز روی همهٔ پلتفرم‌ها در دسترس است؛ با قیمت ۵ دلار به‌ازای هر میلیون توکن ورودی و ۲۵ دلار به‌ازای هر میلیون توکن خروجی (برابر با Opus 4.8). توسعه‌دهندگان می‌توانند با شناسهٔ claude-opus-5 در Claude API شروع کنند. یک حالت «Fast» هم هست که حدود ۲٫۵ برابر سریع‌تر اجرا می‌شود و روی پلتفرم Claude دو برابر قیمت پایه هزینه دارد.

همراه این عرضه، دو قابلیت هم در نسخهٔ بتا آمده: تغییر ابزارها در میانهٔ گفت‌وگو روی پلتفرم Claude بدون باطل‌شدن کش پرامپت، و بازگشت خودکار (fallback) در API که درخواست‌های علامت‌خورده به‌جای مسدودشدن، به بهترین مدل در دسترس هدایت می‌شوند.

جمع‌بندی

روایت Anthropic از Opus 5 روشن است: هوشی نزدیک به قلهٔ Fable 5 با حدود نیمی از هزینه، رکورد در کدنویسی و کار دانشی، و ادعای بالاترین همراستایی. در مقابل، این مدل عمداً در امنیت سایبری تهاجمی و پژوهش زیستی مرزشکنی نکرده و در این حوزه‌ها پشت Mythos 5 مانده است. برای مخاطب فارسی، پیام عملی این است که رقابت مدل‌های پرچم‌دار حالا بیشتر بر سر «هوش بیشتر به‌ازای هر دلار» است تا صرفاً بالاترین امتیاز خام.