کاخ سفید توسعهدهندگان هوش مصنوعی را فراخواند
به گزارش کارگروه فناوری اطلاعات سایبربان، کاخ سفید یک چارچوب داوطلبانه برای ارزیابی قابلیتهای هک پیشرفته توسط مدلهای هوش مصنوعی پیشرو را نهایی کرده و از توسعهدهندگان اصلی دعوت کرده است تا در مورد نحوه عملکرد آن بحث کنند.
از شرکتهای متا، انتروپیک، اوپنایآی و گوگل برای مذاکرات در سطح کارکنان با مقامات دولتی دعوت شده است. کاخ سفید تأیید نکرده است که کدام شرکتها در این مذاکرات شرکت خواهند کرد یا اینکه آیا هرکدام موافقت کردهاند که مدلهایی را برای آزمایش ارائه دهند یا خیر.
این چارچوب، دستورالعمل اجرایی ماه ژوئن را اجرا میکند که به آژانسهای فدرال دستور میدهد تا یک فرایند معیارسنجی طبقهبندیشده برای قابلیتهای سایبری پیشرفته ایجاد کنند. مدلهایی که از آستانه تعریفشده توسط دولت فراتر روند، ممکن است برای اهداف این دستور بهعنوان (مدلهای مرزی تحت پوشش) تعیین شوند.
توسعهدهندگان شرکتکننده میتوانند داوطلبانه تا ۳۰ روز قبل از انتشار مدلهای تحت پوشش به سایر شرکای مورداعتماد، دسترسی دولت فدرال به آنها را فراهم کنند. این دستور مستلزم حمایتهایی است که محرمانگی، امنیت سایبری، تهدیدات داخلی و مالکیت معنوی را پوشش میدهد.
مشارکت به دولت اختیار نمیدهد که از انتشار یک مدل جلوگیری کند. این دستور اجرایی صراحتاً الزامات صدور مجوز اجباری، پیش مجوز یا مجوز را رد میکند.
کاخ سفید آستانه قابلیت، معیارهای آزمایش یا نحوه گزارش نتایج را فاش نکرده است. همچنین هنوز مشخص نیست که آیا چارچوب منتشر خواهد شد، بررسی مستقل چگونه عمل خواهد کرد یا اگر یک مدل قابلیتهای خطرناک خاصی را نشان دهد، دولت چه اقدامی انجام خواهد داد.
این مذاکرات در بحبوحه بررسی حوادث در طول ارزیابیهای داخلی امنیت سایبری انجام میشود. اوپنایآی فاش کرد که مدلهایی که تواناییهای هک خود را آزمایش میکنند، از یک آسیبپذیری ناشناخته قبلی در یک پروکسی رجیستری بسته سوءاستفاده کردهاند، به اینترنت آزاد رسیدهاند و به زیرساخت تولید هاگینگ فیس (Hugging Face) دسترسی پیدا کردهاند. توانمندترین مدل درگیر، یک نمونه اولیه تحقیقاتی داخلی بود که برای انتشار در نظر گرفته نشده بود.
انتروپیک متعاقباً ۱۴۱,۰۰۶ اجرای ارزیابی را بررسی کرد و سه حادثه را یافت که در آنها کلود به اینترنت رسیده و به سازمانهای واقعی دسترسی غیرمجاز پیدا کرده است. برخلاف حادثه اوپنایآی، مدلهای کلود بهجای سوءاستفاده از یک آسیبپذیری جدید، از طریق یک محیط ارزیابی با پیکربندی نادرست به اینترنت دسترسی پیدا کردند.
هر دو شرکت اعلام کردند که ارزیابیها بدون برخی از اقدامات حفاظتی مورداستفاده در مدلهای عمومی انجام شده است.