Anthropic چارچوب امتیازدهی جیلبریک‌های هوش مصنوعی را پیشنهاد داد

هم‌زمان با بازگشت جهانی Claude Fable 5، انتروپیک جزئیات محافظت سایبری مدل و پیش‌نویس یک استاندارد مشترک برای سنجش شدت جیلبریک‌ها را منتشر کرد.

تتحریریه GPT Plus۱ دقیقه مطالعه
قفل دیجیتال و محافظت سایبری مدل هوش مصنوعی

Anthropic پس از عرضه دوباره و جهانی Claude Fable 5، جزئیات بیشتری از طبقه‌بندهای امنیت سایبری آن منتشر کرده و یک چارچوب اولیه برای سنجش شدت جیلبریک مدل‌ها پیشنهاد داده است.

چهار سطح برای درخواست‌های سایبری#

طرح Anthropic درخواست‌ها را از استفاده ممنوع تا استفاده بی‌خطر در چهار گروه می‌گذارد: مخرب، دوکاربردی پرریسک، دوکاربردی کم‌ریسک و عادی. دو گروه اول مسدود می‌شوند، گروه کم‌ریسک زیر نظارت می‌ماند و درخواست عادی اجازه اجرا می‌گیرد.

مسئله این است که ابزار یکسان می‌تواند هم برای دفاع و هم حمله استفاده شود. یافتن آسیب‌پذیری برای تیم امنیتی مفید است، اما همان توانایی ممکن است قدم اول یک حمله باشد. به همین دلیل مدل باید زمینه و هدف درخواست را نیز ارزیابی کند.

چرا استاندارد جیلبریک مهم است؟#

جیلبریک‌ها شدت یکسانی ندارند. برخی فقط محدودیت کوچکی را دور می‌زنند و برخی دامنه بزرگی از خروجی خطرناک را باز می‌کنند. نبود زبان مشترک، مقایسه گزارش‌های امنیتی شرکت‌ها و گفت‌وگو با دولت‌ها را سخت کرده است.

پیش‌نویس جدید می‌خواهد شدت، قابلیت تکرار و دامنه اثر یک جیلبریک را قابل مقایسه کند. Anthropic از پژوهشگران، دولت‌ها و شرکت‌های دیگر برای نقد آن دعوت کرده و برنامه گزارش باگ HackerOne نیز راه انداخته است.

هنوز چه چیزی روشن نیست؟#

این چارچوب هنوز استاندارد صنعتی نیست و داده مستقل کافی درباره نرخ خطاهای طبقه‌بند Fable 5 منتشر نشده است. ارزش واقعی پیشنهاد زمانی مشخص می‌شود که آزمایشگاه‌های رقیب روش مشترک را بپذیرند و نتایج قابل ممیزی منتشر کنند.

منبع: جزئیات فنی Anthropic

منبع خبر
Anthropic

این مطلب گزارش و تحلیل مستقل تحریریه GPT Plus بر پایه منبع بالا است.

اشتراک‌گذاری:تلگرامواتساپX
ت
تحریریه GPT Plus

خبرهای مهم هوش مصنوعی و فناوری را از منابع اصلی بررسی می‌کنیم و با زمینه، محدودیت‌ها و اثر عملی آن‌ها به فارسی گزارش می‌دهیم.