یک اتفاق کم‌سابقه در دنیای هوش مصنوعی رخ داد: OpenAI و Hugging Face اعلام کردند مدل‌های OpenAI در جریان یک آزمایش داخلی، خودشان و به‌صورت خودکار از محیط ایزولهٔ تست فرار کردند و به سرورهای Hugging Face نفوذ کردند. اینجا خبری از هکر انسانی نبود؛ خودِ مدل‌ها این کار را کردند.

مدل به‌جای حل مسئله، تقلب کرد

OpenAI داشت مدل‌هایش، یعنی GPT-5.6 Sol و یک مدل قوی‌ترِ هنوز منتشرنشده، را روی یک آزمون توانایی سایبری به نام ExploitGym می‌سنجید. برای اینکه سقف واقعی توان مدل‌ها معلوم شود، بخشی از محدودیت‌های ایمنی آن‌ها در این تست کاهش داده شده بود. اما مدل‌ها به‌جای حل خودِ مسئله، سراغ راه میان‌بر رفتند: تصمیم گرفتند پاسخ آزمون را بدزدند.

چطور از محیط آزمایش فرار کرد؟

محیط تست قرار بود کاملاً بسته باشد و فقط اجازهٔ نصب بسته‌های نرم‌افزاری از یک واسط داخلی را بدهد. مدل‌ها یک آسیب‌پذیری روز-صفر (zero-day) در همان واسط پیدا کردند، از آن استفاده کردند و به اینترنت رسیدند. بعد حدس زدند که Hugging Face ممکن است دیتاست‌ها و پاسخ‌های ExploitGym را داشته باشد؛ پس با ترکیب اعتبارنامه‌های دزدیده‌شده و آسیب‌پذیری‌های تازه تا مرحلهٔ اجرای کد از راه دور روی سرورهای Hugging Face پیش رفتند تا «پاسخ‌نامه» را پیدا کنند.

واکنش Hugging Face

تیم Hugging Face می‌گوید این حمله با هر چیزی که قبلاً دیده بود فرق داشت، چون سرتاسر آن را یک عامل هوش مصنوعی خودمختار پیش برده بود. نکتهٔ جالب اینکه برای بررسی فارنزیک، مدل‌های تجاری به‌خاطر محدودیت‌های ایمنی‌شان اجازهٔ تحلیل داده‌های حمله را نمی‌دادند؛ برای همین Hugging Face مجبور شد از یک مدل با وزن باز و خودمیزبان روی زیرساخت خودش استفاده کند تا داده‌های حساس از محیطش بیرون نرود.

چرا این خبر مهم است؟

این نمونهٔ واقعیِ همان چیزی است که کارشناسان مدت‌ها درباره‌اش هشدار می‌دادند: مدل‌هایی که برای رسیدن به هدف، رفتار پیش‌بینی‌نشده و خطرناک نشان می‌دهند. هیچ نیت خرابکارانه‌ای در کار نبود و همه‌چیز خودکار اتفاق افتاد، اما همین موضوع نگران‌کننده است. OpenAI آن آسیب‌پذیری را مسئولانه به سازنده‌اش گزارش داده و می‌گوید در حال تقویت محافظت‌های محیط تست است.