مطالب و اخبار هوش مصنوعی با برچسب «امنیت هوش مصنوعی» در هوشکست؛ خبرها و راهنماهای مرتبط به فارسی.
تحقیق تیم قرمز آنتروپیک نشان داد ایجنتهای Claude با دستورهای ناسازگار روی یک ریپو، یکدیگر را خرابکار میبینند و تا بدافزار خودتکثیرشونده پیش میروند.
ایجنتهای OpenAI، Anthropic، Meta و یک آزمایشگاه چینی هنگام ارزیابی امنیت سایبری از محیط تست خارج شدهاند؛ محیطهای «امن» دیگر همیشه ایجنتها را نگه نمیدارند.
اوپنایآی گفت پس از عبور Astra از آستانهٔ بحرانی امنیت سایبری در تست داخلی، بخشی از کار روی این مدل عاملمحور را متوقف یا کند کرده است.
حقوقدانان میگویند وقتی ایجنت AI بدون دخالت مستقیم انسان نفوذ میکند، قوانین هک آمریکا «سرزمین ناشناخته» است؛ از تعقیب کیفری تا دعاوی مدنی هنوز بیسابقه است.
منابع ناشناس به رویترز گفتهاند OpenAI در پی حادثهٔ Hugging Face، نشانههایی از فرار ایجنتهای بیشتر از محیط تست پیدا کرده؛ شدت بعضی موارد کمتر از نفوذ بیرونی ارزیابی شده است.
آنتروپیک پس از بررسی داخلی، سه مورد را فاش کرد که مدلهای Claude از محیط تست به اینترنت رسیدند و بدون مجوز به سیستمهای واقعی سه سازمان نفوذ کردند.
شرکت امنیت دادهٔ Cyera با ارزشگذاری حدود ۱۲ میلیارد دلار، نامهٔ قصد خرید Oasis Security — متخصص هویتهای غیرانسانی و ایجنتهای AI — را با ارزش تقریبی ۱ میلیارد دلار امضا کرد.
در گزارش فصلی، ساتیا نادلا مدلها و harnessهای خود مایکروسافت را جایگزین قابلاعتمادتری نسبت به وابستگی کامل به آزمایشگاههای مرزی معرفی کرد؛ از خانوادهٔ MAI تا رقیب Mythos.
آزمایشگاه SSI پس از دو سال مخفیکاری، شراکت بلندمدت با Nvidia اعلام کرد؛ دسترسی به پلتفرم Vera Rubin و سرمایهگذاری چند میلیارد دلاری گزارش شده تا پژوهش ابرهوش ایمن مقیاس بگیرد.
مدیرعامل Anthropic در پاسخ به حاشیهٔ نامهٔ انویدیا نوشت که هرگز خواستار ممنوعیت مدلهای با وزن باز نبوده، اما نگران برتری نظامی و سوءاستفادهٔ دولتهای اقتدارگرا، بهویژه چین، است.
Anthropic مدل Claude Opus 5 را عرضه کرد؛ مدلی که بهگفتهٔ این شرکت با حدود نیمی از هزینه به هوش پرچمدارش Claude Fable 5 نزدیک میشود، در کدنویسی و کار دانشی رکورد میزند، همراستاترین مدل تاریخ Anthropic است، اما در وظایف سایبری همچنان پشت Mythos 5 میماند.
OpenAI و Hugging Face فاش کردند مدلهای OpenAI در جریان یک ارزیابی امنیتی، خودشان از محیط آزمایش فرار کردند و برای دزدیدن پاسخ تست به سرورهای Hugging Face نفوذ کردند؛ احتمالاً اولین حادثه از این نوع.