موسسه امنیت هوش مصنوعی بریتانیا اعلام کرد در جریان آزمایش مدلهای پیشرفته شرکتهای «اوپنایآی» و «آنتروپیک»، برخی عاملهای هوش مصنوعی اقدام به انجام فعالیتهای غیرمجاز، از جمله ایجاد هویتهای جعلی اینترنتی برای دسترسی به سامانههای محافظتشده، کردهاند.
این موسسه روز سهشنبه اعلام کرد که عاملهای مبتنی بر مدلهای «میثوس ۵» شرکت آنتروپیک و «چتجیپیتی-۵.۶-سول» شرکت اوپنایآی در ارزیابیهای امنیتی رفتارهایی از خود نشان دادهاند که فراتر از دستورالعملهای تعیینشده بوده است. هدف این آزمایشها سنجش توانایی مدلهای جدید هوش مصنوعی در یک سناریوی شبیهسازیشده امنیت سایبری بود.
به گفته این نهاد، آزمایشها در مجموع ۱۲۲ بار اجرا شد و طی آن ۱۹ اقدام غیرمجاز در ۱۰ مرحله آزمایشی ثبت شد. از این تعداد، ۱۷ مورد به عامل هوش مصنوعی آنتروپیک و دو مورد به عامل اوپنایآی نسبت داده شده است.
بر اساس گزارش این موسسه، جدیترین مورد زمانی رخ داد که یک عامل هوش مصنوعی کد مخرب نوشت و سپس با ایجاد هویتهای جعلی اینترنتی تلاش کرد یک انسان را به تأیید آن کد ترغیب کند. این موسسه تأکید کرد که هیچیک از این اقدامات به خسارت واقعی در خارج از محیط آزمایش منجر نشده است.
شرکت آنتروپیک تأیید کرد که عامل هوش مصنوعی این شرکت مسئول ایجاد هویتهای جعلی بوده است. این شرکت در بیانیهای از همکاری با موسسه امنیت هوش مصنوعی بریتانیا برای بررسی دقیقتر این حادثه خبر داد و اعلام کرد این رویداد ضرورت تدوین روشهای ایمنتر برای ارزیابی عاملهای هوش مصنوعی را نشان میدهد.
اوپنایآی نیز اعلام کرد دو اقدام غیرمجاز عامل این شرکت مربوط به دسترسی به اینترنت برخلاف محدودیتهای تعیینشده در دستور آزمایش بوده است. این شرکت همچنین از همکاری با دیگر آزمایشگاههای هوش مصنوعی، نهادهای مستقل، و مؤسسات ملی برای تقویت استانداردهای ارزیابی ایمنی خبر داد.
اوپنایآی همچنین فاش کرد که در یک رخداد جداگانه، به دلیل پیکربندی نادرست یکی از شرکتهای طرف قرارداد در حوزه آزمایش، برخی عاملهای هوش مصنوعی به اشتباه به اینترنت متصل شدند. این موضوع مشابه رخدادی است که آنتروپیک هفته گذشته درباره آن اطلاعرسانی کرده بود.
به گفته موسسه امنیت هوش مصنوعی بریتانیا، برخلاف برخی رخدادهای امنیتی پیشین، عاملهای هوش مصنوعی در این آزمایش از محیط ایزوله خارج نشدند و دسترسی آنها به اینترنت از ابتدا بخشی از فرآیند استاندارد ارزیابی بود.