Anthropic چارچوب امتیازدهی جیلبریکهای هوش مصنوعی را پیشنهاد داد
همزمان با بازگشت جهانی Claude Fable 5، انتروپیک جزئیات محافظت سایبری مدل و پیشنویس یک استاندارد مشترک برای سنجش شدت جیلبریکها را منتشر کرد.
Anthropic پس از عرضه دوباره و جهانی Claude Fable 5، جزئیات بیشتری از طبقهبندهای امنیت سایبری آن منتشر کرده و یک چارچوب اولیه برای سنجش شدت جیلبریک مدلها پیشنهاد داده است.
چهار سطح برای درخواستهای سایبری#
طرح Anthropic درخواستها را از استفاده ممنوع تا استفاده بیخطر در چهار گروه میگذارد: مخرب، دوکاربردی پرریسک، دوکاربردی کمریسک و عادی. دو گروه اول مسدود میشوند، گروه کمریسک زیر نظارت میماند و درخواست عادی اجازه اجرا میگیرد.
مسئله این است که ابزار یکسان میتواند هم برای دفاع و هم حمله استفاده شود. یافتن آسیبپذیری برای تیم امنیتی مفید است، اما همان توانایی ممکن است قدم اول یک حمله باشد. به همین دلیل مدل باید زمینه و هدف درخواست را نیز ارزیابی کند.
چرا استاندارد جیلبریک مهم است؟#
جیلبریکها شدت یکسانی ندارند. برخی فقط محدودیت کوچکی را دور میزنند و برخی دامنه بزرگی از خروجی خطرناک را باز میکنند. نبود زبان مشترک، مقایسه گزارشهای امنیتی شرکتها و گفتوگو با دولتها را سخت کرده است.
پیشنویس جدید میخواهد شدت، قابلیت تکرار و دامنه اثر یک جیلبریک را قابل مقایسه کند. Anthropic از پژوهشگران، دولتها و شرکتهای دیگر برای نقد آن دعوت کرده و برنامه گزارش باگ HackerOne نیز راه انداخته است.
هنوز چه چیزی روشن نیست؟#
این چارچوب هنوز استاندارد صنعتی نیست و داده مستقل کافی درباره نرخ خطاهای طبقهبند Fable 5 منتشر نشده است. ارزش واقعی پیشنهاد زمانی مشخص میشود که آزمایشگاههای رقیب روش مشترک را بپذیرند و نتایج قابل ممیزی منتشر کنند.
منبع: جزئیات فنی Anthropic
خبرهای مهم هوش مصنوعی و فناوری را از منابع اصلی بررسی میکنیم و با زمینه، محدودیتها و اثر عملی آنها به فارسی گزارش میدهیم.
خبرهای مرتبط
کلود در ۲۰ ساعت ۴۶۶ میلیون خط کد دولتی را بررسی کرد
دولت آلبرتا میگوید حدود ۵۰ عامل Claude Code در ۲۰ ساعت ۴۶۶ میلیون خط کد را برای آسیبپذیریهای امنیتی بررسی و برای بخشی از آنها اصلاح تولید کردند.
هشدار پنل علمی سازمان ملل: سیاستگذاری از AI عقب مانده است
گزارش مقدماتی پنل علمی مستقل سازمان ملل میگوید تواناییهای هوش مصنوعی سریعتر از فهم علمی و سیاست عمومی پیش میروند و عدم قطعیتهای جدی باقی است.
Claude Science؛ میزکار هوش مصنوعی برای پژوهشگران عرضه شد
Claude Science ابزارها، دیتابیسها، کدنویسی و منابع محاسباتی پژوهش را در یک محیط جمع میکند و برای هر نمودار و نتیجه، مسیر قابل ممیزی نگه میدارد.