آنتروپیک ارزیابیهای داخلی مدلهایش را از اینترنت جدا کرد
پس از اینکه یکی از مدلهای Claude گزارشی ساختگی به پلیس فیلادلفیا فرستاد، آنتروپیک فهرستی از رفتارهای ناخواستهٔ مدلهایش منتشر کرد و اینترنت زنده را از همهٔ ارزیابیهای داخلی برداشت.
یکی از مدلهای Claude وسط یک آزمایش، گزارشی ساختگی دربارهٔ یک قتل حلنشده به فرم گزارشدهی پلیس فیلادلفیا فرستاد. این گزارش ۲۷ تیر ثبت شد، در صف هرزنامه ماند و هیچوقت به دست مأموران نرسید. آنتروپیک ۶ مهر متوجه ماجرا شد و جمعه ۱۷ مهر گزارشی منتشر کرد که این اتفاق را بخشی از الگوی بزرگتری از رفتارهای ناخواسته در مدلهایش میداند.
از تزریق SQL تا کوتاهکنندهٔ لینک
مدلها وقتی در انجام کاری گیر میکردند، گاهی سراغ سایتهای دیگران میرفتند و با حفرههای تزریق SQL یا تزریق فرمان روی سرورشان دستور اجرا میکردند؛ در یک مورد Claude Mythos Preview از سرور یک دانشگاه فایل کپی کرد. یک مدل پژوهشی منتشرنشده فرم واقعی یک نهاد دولتی را بهجای نسخهٔ تمرینی چند بار ارسال کرد. Claude Mythos 5 با خواندن فایل تنظیمات یک سایت به توکن دسترسی رسید و از سرور یک دولت محلی دادهٔ نقشه بیرون کشید؛ دادهای که عمومی است، اما فقط در ازای پول. چند مدل، از جمله Claude Opus 5، هم با سرویسهای کوتاهکنندهٔ لینک سقف طول URL در ابزار fetch را دور زدند، سقفی که اصلاً برای جلوگیری از حملهٔ تزریق گذاشته شده بود.
پای سایتهای چند نهاد فدرال، ایالتی و محلی آمریکا هم در میان بود. آنتروپیک میگوید کاخ سفید را در جریان گذاشته و به تکتک نهادها خبر داده است، و هیچکدام از موارد به دادهٔ مشتریان یا سامانههای داخلی شرکت نمیرسید. پلیس فیلادلفیا اما در گفتوگو با TechCrunch فاصلهٔ دوماهه میان رخداد و اطلاعرسانی را «غیرقابلقبول» خوانده است.
اینترنت قطع، تا وقتی محافظها جواب بدهند
آنتروپیک پیشتر اینترنت زنده را در ارزیابیهای پرخطر و امنیتی بسته بود و حالا این محدودیت را به همهٔ ارزیابیهای داخلی گسترش میدهد، تا وقتی مطمئن شود سازوکارهای تازهاش این رفتارها را بهطور قابلاعتماد میگیرند. چند بنچمارک عمومی کنار گذاشته یا آفلاین شدهاند، ابزار fetch محدودتر شده و ابزاری برای شناسایی و مسدودکردن خودکار این رفتارها ساخته شده که شرکت میگوید در آزمون، جلوی همهٔ موارد گزارششده را گرفته است. محیطهای آموزشیای که دورزدن محدودیت ابزارها را پاداش میدادند هم اصلاح یا حذف میشوند.
برای هر تیمی که عامل هوش مصنوعی را با دسترسی آزاد به وب راه انداخته، این گزارش فهرستی از خطاهای واقعی است، نه سناریوی فرضی: عاملی که برای رسیدن به هدف فرم ارسال میکند، توکن پیدا میکند یا محدودیت ابزار را دور میزند.