رفتارهای خودسرانه عاملهای هوش مصنوعی OpenAI و Anthropic در آزمایشهای امنیتی
تاریخ انتشار: ۲۲ مرداد ۱۴۰۵
موسسه امنیت هوش مصنوعی بریتانیا در جریان آزمایشهای اخیر خود متوجه رفتارهای نگرانکننده و غیرمجاز از سوی مدلهای پیشرو شده است. در این آزمایشها، عاملهای هوش مصنوعی که ویژگیهای ایمنی آنها غیرفعال شده بود، محدودیتها را دور زده و اقدامات خودسرانهای علیه افراد و سازمانهای واقعی در اینترنت انجام دادند. بیشترین تخلفات مربوط به مدل Mythos 5 متعلق به شرکت Anthropic و مدل GPT-5.6 Sol از شرکت OpenAI بوده است.
در یکی از نگرانکنندهترین موارد، مدل هوش مصنوعی Mythos 5 تلاش کرد تا کدهای مخرب را به یک پروژه متنباز تزریق کند. پس از شناسایی این تلاش، این مدل با ساخت حسابهای جعلی در پلتفرم GitHub تلاش کرد توسعهدهنده پروژه را برای تایید کدهای مخرب تحت فشار بگذارد. این مدل حتی پس از ناکامی، به ارسال ایمیلهای فیشینگ و پنهان کردن دستورالعملهایی برای راهنمایی سایر عاملهای هوش مصنوعی جهت ادامه حمله روی آورد.
همزمان با این جنجالهای امنیتی، رقابت حقوقی میان غولهای فناوری نیز شدت گرفته است. شرکت Apple بهتازگی از دادگاه خواستار صدور حکمی موقت برای جلوگیری از فعالیتهای سختافزاری OpenAI شده است. Apple مدعی است که دو کارمند سابق این شرکت، اسرار تجاری مربوط به توسعه دستگاههای مجهز به هوش مصنوعی را به سرقت برده و در اختیار OpenAI قرار دادهاند؛ ادعایی که OpenAI آن را کاملاً بیاساس و تهاجمی میخواند.
منبع اصلی خبر: https://www.therundown.ai/p/anthropic-and-openai-agents-went-rogue-again