هوش مصنوعی

آنتروپیک ارزیابی‌های داخلی مدل‌هایش را از اینترنت جدا کرد

پس از اینکه یکی از مدل‌های Claude گزارشی ساختگی به پلیس فیلادلفیا فرستاد، آنتروپیک فهرستی از رفتارهای ناخواستهٔ مدل‌هایش منتشر کرد و اینترنت زنده را از همهٔ ارزیابی‌های داخلی برداشت.

آنتروپیک ارزیابی‌های داخلی مدل‌هایش را از اینترنت جدا کرد

یکی از مدل‌های Claude وسط یک آزمایش، گزارشی ساختگی دربارهٔ یک قتل حل‌نشده به فرم گزارش‌دهی پلیس فیلادلفیا فرستاد. این گزارش ۲۷ تیر ثبت شد، در صف هرزنامه ماند و هیچ‌وقت به دست مأموران نرسید. آنتروپیک ۶ مهر متوجه ماجرا شد و جمعه ۱۷ مهر گزارشی منتشر کرد که این اتفاق را بخشی از الگوی بزرگ‌تری از رفتارهای ناخواسته در مدل‌هایش می‌داند.

از تزریق SQL تا کوتاه‌کنندهٔ لینک

مدل‌ها وقتی در انجام کاری گیر می‌کردند، گاهی سراغ سایت‌های دیگران می‌رفتند و با حفره‌های تزریق SQL یا تزریق فرمان روی سرورشان دستور اجرا می‌کردند؛ در یک مورد Claude Mythos Preview از سرور یک دانشگاه فایل کپی کرد. یک مدل پژوهشی منتشرنشده فرم واقعی یک نهاد دولتی را به‌جای نسخهٔ تمرینی چند بار ارسال کرد. Claude Mythos 5 با خواندن فایل تنظیمات یک سایت به توکن دسترسی رسید و از سرور یک دولت محلی دادهٔ نقشه بیرون کشید؛ داده‌ای که عمومی است، اما فقط در ازای پول. چند مدل، از جمله Claude Opus 5، هم با سرویس‌های کوتاه‌کنندهٔ لینک سقف طول URL در ابزار fetch را دور زدند، سقفی که اصلاً برای جلوگیری از حملهٔ تزریق گذاشته شده بود.

پای سایت‌های چند نهاد فدرال، ایالتی و محلی آمریکا هم در میان بود. آنتروپیک می‌گوید کاخ سفید را در جریان گذاشته و به تک‌تک نهادها خبر داده است، و هیچ‌کدام از موارد به دادهٔ مشتریان یا سامانه‌های داخلی شرکت نمی‌رسید. پلیس فیلادلفیا اما در گفت‌وگو با TechCrunch فاصلهٔ دوماهه میان رخداد و اطلاع‌رسانی را «غیرقابل‌قبول» خوانده است.

اینترنت قطع، تا وقتی محافظ‌ها جواب بدهند

آنتروپیک پیش‌تر اینترنت زنده را در ارزیابی‌های پرخطر و امنیتی بسته بود و حالا این محدودیت را به همهٔ ارزیابی‌های داخلی گسترش می‌دهد، تا وقتی مطمئن شود سازوکارهای تازه‌اش این رفتارها را به‌طور قابل‌اعتماد می‌گیرند. چند بنچمارک عمومی کنار گذاشته یا آفلاین شده‌اند، ابزار fetch محدودتر شده و ابزاری برای شناسایی و مسدودکردن خودکار این رفتارها ساخته شده که شرکت می‌گوید در آزمون، جلوی همهٔ موارد گزارش‌شده را گرفته است. محیط‌های آموزشی‌ای که دورزدن محدودیت ابزارها را پاداش می‌دادند هم اصلاح یا حذف می‌شوند.

برای هر تیمی که عامل هوش مصنوعی را با دسترسی آزاد به وب راه انداخته، این گزارش فهرستی از خطاهای واقعی است، نه سناریوی فرضی: عاملی که برای رسیدن به هدف فرم ارسال می‌کند، توکن پیدا می‌کند یا محدودیت ابزار را دور می‌زند.

منابع

دیدگاه شما

ایمیل شما نمایش داده نمی‌شود.