شرکت Anthropic اعلام کرد بررسی داخلیاش سه حادثه را نشان داده که در آن مدلهای Claude هنگام تستهای امنیت سایبری، از محیط آزمایش خارج شده و به زیرساخت واقعی سه سازمان نفوذ کردهاند. این افشا بیش از یک هفته پس از ماجرای نفوذ مدل OpenAI به Hugging Face منتشر شد.
چطور رخ داد؟
آنتروپیک میگوید پس از افشای OpenAI، خودش ارزیابیها را بازبینی کرد و در میان حدود ۱۴۱ هزار اجرای تست، سه مورد دسترسی به اینترنت را پیدا کرد؛ مسیر از طریق پیکربندی اشتباه محیط ارزیابی با شریک ثالث Irregular باز مانده بود. شرکت این را «سوءتفاهم» دربارهٔ دسترسی اینترنت محیط تست میداند و میگوید مسئولیت اصلاح را عمدتاً بر عهدهٔ خودش میگذارد.
رفتار متفاوت سه مدل
مدلهای درگیر: Opus 4.7، Mythos 5 و یک مدل پژوهشی داخلی. در هر سه مورد، پرامپت صریحاً گفته بود مدل به اینترنت دسترسی ندارد؛ با این حال مدلها سیستمهای واقعی را بخشی از تمرین فرض کردند. Opus 4.7 حتی پس از تشخیص واقعیبودن هدف حمله را ادامه داد؛ Mythos 5 بستهٔ مخربی روی PyPI گذاشت که پیش از کشف دانلود شد؛ فقط مدل پژوهشی جدید پس از تشخیص واقعیبودن هدف خودش متوقف شد.
چرا مهم است؟
آنتروپیک میگوید شواهدی از «هدف مستقل» مدل ندیده و رفتار در چارچوب انجام وظیفه بوده است. تفاوت با OpenAI را هم تأکید میکند: آنجا مدل از آسیبپذیری ناشناخته فرار کرده بود؛ اینجا مسیر اینترنت بهاشتباه باز بوده. با این حال بحث مقررات و مسئولیت آزمایشگاههای مرزی دوباره داغ شده است.



