ناوبری اصلی

مدل‌های gpt-oss-safeguard از OpenAI چه معنایی برای ایمنی هوش مصنوعی دارند؟

ارزیابی اولیه مدل‌های gpt-oss-safeguard از OpenAI نشان می‌دهد مدل‌های تخصصی ایمنی کجا می‌توانند سیستم‌های عملیاتی هوش مصنوعی را تقویت کنند.

در دو سال گذشته، راهکارهایی ساخته‌ایم که با حفظ ایمنی، در مقیاس میلیون‌ها کاربر گسترش یافته‌اند. بخش مهمی از این کار، طراحی سیستم‌های نظارت سریع و دقیق بوده است. نظارت مؤثر به شرکت‌ها امکان می‌دهد راهکارهای پیشرفته هوش مصنوعی را با اطمینان به کار گیرند؛ کاربران نهایی را از آسیب حفظ کنند و با شناسایی خروجی‌های ناخواسته پیش از مشکل‌ساز شدن، ایمنی برند را تضمین کنند.

اخیراً OpenAI مدل‌های GPT-OSS-Safeguard خود را منتشر کرد: نسخه‌های تنظیم‌دقیق‌شده مدل‌های متن‌باز 20B و 120B که اوایل امسال معرفی شدند. این مدل‌ها می‌توانند سیاست کاربر را مستقیماً هنگام استنتاج تفسیر کنند و رویکردی انعطاف‌پذیر و قدرتمند برای نظارت بر محتوا ارائه دهند. این مدل‌ها در مرحله پیش‌نمایش پژوهشی هستند و بی‌شک با گذشت زمان بهتر خواهند شد.

پیش از این انتشار با OpenAI همکاری کردیم و برای کمک به توسعه مدل، ارزیابی‌هایی در شرایط واقعی انجام دادیم. در این مقاله، یافته‌های حاصل از این همکاری را به اشتراک می‌گذاریم و بررسی می‌کنیم که این پیشرفت‌ها برای آینده نظارت در سیستم‌های عملیاتی هوش مصنوعی چه معنایی دارند.

نظارت در محیط عملیاتی امروز چگونه کار می‌کند؟

امروزه راهکارهای نظارت معمولاً به‌شکل لایه‌های محافظی پیرامون برنامه ساخته می‌شوند. ما در پیاده‌سازی‌های عمومی و پرترافیک، بسیار از این الگو استفاده می‌کنیم. برای بررسی عمیق‌تر، می‌توانید وبلاگ ما را دراین‌باره از اینجا بخوانید.

  1. ورودی‌ها را موازی طبقه‌بندی کنید (اجازه ورود اعلان‌های بد را ندهید): طبقه‌بندهای کوچک و موضوع‌محور هم‌زمان اجرا می‌شوند تا هر پیام کاربر را برچسب‌گذاری کنند. دریافته‌ایم طبقه‌بندهایی با تمرکز محدود، به‌طور قابل‌اندازه‌گیری از یک طبقه‌بند همه‌منظوره قابل‌اعتمادترند. نمونه‌های چند نمونه که با دقت در اعلان انتخاب شده‌اند، می‌توانند تفاوت میان «I keep getting killed by this boss» (در بافت بازی و کاملاً بی‌خطر) و نشانه‌ای از آسیب در دنیای واقعی را روشن کنند.

    • ایمن ← تولید عادی

    • دور زدن محدودیت‌ها ← نادیده‌گرفتن یا منحرف‌کردن با پاسخی منطبق با لحن برند

    • خطرهای ایمنی یا سلامت روان ← ارجاع به انسان همراه با اطلاعات زمینه‌ای کامل

  2. خروجی‌ها را طبقه‌بندی کنید (پاسخ بد تحویل ندهید): هر پاسخ پیشنهادی پیش از ارسال دوباره بررسی می‌شود. این کار در برابر انحراف مدل، مسموم‌سازی داده‌های RAG و موارد مرزی ظریف سیاست مانند محتوای زیان‌بار، افشای اطلاعات هویتی شخصی یا نشت اطلاعات حساس محافظت می‌کند. اگر پاسخی علامت‌گذاری شود، به‌جای ارسال چیزی که بعداً پشیمانمان کند، پاسخ تولیدشده توسط الگوهای زبانی بزرگ (LLM) را با پیامی ایمن و هماهنگ با برند جایگزین می‌کنیم یا آن را به یک انسان ارجاع می‌دهیم.

  3. آن را سریع و مقرون‌به‌صرفه کنید: ساخت اعلان‌ها به‌صورت اجزای قابل‌استفاده مجدد، امکان ذخیره موقت بخش‌های اعلان، نمونه‌های چند نمونه طبقه‌بند و پیشوندهای رایج گفت‌وگو را فراهم می‌کند. این رویکرد هم تأخیر و هم هزینه موانع حفاظتی شما را کاهش می‌دهد.

  4. ایمنی را بخشی از تجربه محصول بدانیدپیام‌های امتناع و هشدار با لحن محصول نوشته می‌شوند؛ مثلاً برای بازی‌ها سرگرم‌کننده و برای امور مالی رسمی. وقتی تجربه کاربری به قصد کاربر احترام بگذارد، پذیرش موانع حفاظتی بیشتر و تلاش‌ها برای دور زدن محدودیت‌ها کمتر می‌شود.

  5. پایش کنید، تیم قرمز را به کار بگیرید و چرخه بازخورد را تکمیل کنیدآزمون‌های مستمر تیم قرمز و داشبوردهای زنده ایمنی کمک می‌کنند پسرفت‌ها پیش از رسیدن به کاربران شناسایی شوند. با افزودن نمونه‌های چند نمونه و/یا قواعد مسیریابی می‌توانیم الگوهای حمله جدید را به مدل بیاموزیم تا بدون لطمه به عملکرد برنامه، نفوذ به سیستم به‌مرور دشوارتر شود.

چالش‌های ساخت راهکار نظارت در دنیای امروز

ساخت و نگهداری موانع حفاظتی مؤثر دشوار است.

در عمل، تدوین سیاستی دقیق و روشن مستلزم همکاری سنجیده میان ذی‌نفعان اصلی کسب‌وکار و توسعه‌دهندگان است. پس از تعریف سیاست نیز باید طراحی و رفتار سیستم پیاده‌سازی و تنظیم شود.

ظهور مدل‌های بازِ استدلال ایمنی مانند gpt-oss-safeguard می‌تواند برخی مشکلات این فرایند را برطرف کند و پایه‌ای آماده‌تر و انعطاف‌پذیرتر برای نظارت بر محتوا فراهم آورد.

ظرفیت مدل‌های تخصصی ایمنی

Gpt-oss-safeguard با هدف رفع برخی چالش‌های رایج در ساخت سیستم‌های نظارت امروزی طراحی شده است. این مدل‌های کوچک و تخصصی تنظیم دقیق شده‌اند تا هنگام استنتاج درباره یک سیاست هدف استدلال کنند و به‌دنبال محتوای زیان‌بار یا حساس مانند دور زدن محدودیت‌ها، افشای اطلاعات هویتی شخصی و دیگر موارد نقض سیاست بگردند.

آن‌ها با گنجاندن استدلال در فرایند طبقه‌بندی، نظارتی دقیق‌تر و مقاوم‌تر ارائه می‌دهند که دور زدن آن دشوارتر است. این مدل‌ها به‌عنوان نسخه‌های تخصصی ایمنی GPT-OSS 20B و 120B، عملکردی پیشرفته در حوزه ایمنی ارائه می‌دهند و به‌لطف تعریف سیاست‌های سفارشی، به حداقل راه‌اندازی نیاز دارند.

آنچه آزمایش کردیم

مدل‌های gpt-oss-safeguard 20B و 120B را در چند وظیفه مشابه محیط عملیاتی ارزیابی کردیم: دستیار صوتی بلادرنگ، ربات پشتیبانی بازیکنان درون‌بازی، سیستم نظارت پیش‌دستانه بر گفت‌وگو و پایش چندزبانه محتوای سمی به زبان‌های اسپانیایی، فرانسوی، ایتالیایی، پرتغالی، روسی و ترکی.

یافته‌های ما

  • نظارت صوتی حساس به تأخیر: در آزمایش‌های صوتی بلادرنگ ما، یعنی طبقه‌بندی زنده درون مکالمه که پاسخ باید تحلیل و اولویت‌بندی شود، مانند نظارت بر گفت‌وگوی بازی، gpt-oss-safeguard-20B حدود ۸۰٪ از شکاف دقت میان GPT-OSS-20B و GPT-5-Mini را جبران کرد (۰٫۷۱ در برابر ۰٫۷۸، نسبت به ۰٫۴۵) و درعین‌حال با تأخیر بسیار کمتری اجرا شد.

  • ارجاع در پشتیبانی بازیکنان: در اولویت‌بندی پشتیبانی بازیکنان، gpt-oss-safeguard-20B حدود ۹۰٪ از شکاف میان GPT-OSS-20b و GPT-5-Mini را جبران کرد (۰٫۶۶ در برابر ۰٫۶۷، نسبت به ۰٫۵۷). همچنین بهترین دقت کلان در میان مدل‌های آزمایش‌شده، یادآوری ۸۸٪ برای محتوای بی‌خطر و دقت ۸۷٪ در شناسایی کاربران آسیب‌پذیر را ارائه داد؛ مناسب برای ارجاع‌های محافظه‌کارانه و قابل‌اعتماد، بدون آنکه ناظران انسانی با انبوه موارد روبه‌رو شوند.

  • نظارت مقیاس‌پذیر بر گفت‌وگو با سیاست‌های فشرده: در دشوارترین ارزیابی ما، که سیستم نظارت باید پیام‌های درون‌بازی را مطابق سندی مفصل از سیاست‌ها پیش‌دستانه علامت‌گذاری کند، gpt-oss-safeguard با اختلافی روشن از مدل پایه OSS بهتر عمل کرد، حدود ۳۵٪ بهبود نسبی داشت و سیاست‌های طولانی را به‌خوبی مدیریت کرد. این کاربرد بسیار حساس است و به یادآوری و دقت بالایی نیاز دارد. اگر یادآوری بیش‌ازحد پایین باشد، بسیاری از پیام‌های زیان‌بار شناسایی نمی‌شوند. دقت پایین نیز باعث می‌شود بسیاری از پیام‌های نامرتبط برای ناظران انسانی علامت‌گذاری شوند و توجه آن‌ها از موارد واقعاً دشوار منحرف شود.

  • عملکرد چندزبانه: در یک مجموعه‌داده متوازن از محتوای سمی به شش زبان، عملکرد gpt-oss-safeguard نزدیک به GPT-5-Mini بود و اختلاف دقت معمولاً در محدوده ۳ تا ۵ واحد درصد قرار داشت؛ gpt-oss-safeguard-120B در زبان اسپانیایی اندکی بهتر بود. در زبان‌های کم‌منبع مانند ترکی شکاف‌های اندکی بزرگ‌تر مشاهده کردیم، اما الگوی کلی نشان‌دهنده عملکرد مطلوب بین‌زبانی بود و با ارتقا از 20B به 120B، یادآوری به‌طور مستمر افزایش یافت.

همچنین مشاهده کردیم مدل‌های gpt-oss-safeguard در حوزه‌هایی که الگوهای زبانی بزرگ (LLM) معمولاً در نظارت ضعیف‌ترند عملکرد خوبی دارند؛ از جمله داده‌های هویتی شخصی، زیرا مدل‌های رایج بیشتر به شناسایی اطلاعات هویتی رایج در آمریکا گرایش دارند و در دیگر مناطق جغرافیایی ضعیف‌تر عمل می‌کنند. بر این اساس، معتقدیم gpt-oss-safeguard با کاهش وابستگی به ابزارهای سفارشی برای شناسایی نقض‌های جزئی سیاست که الگوهای زبانی بزرگ (LLM) عمومی‌تر از عهده آن‌ها برنمی‌آیند، به ساده‌سازی راه‌اندازی نظارت کمک خواهد کرد.

قدرت تنظیم دقیق هدفمند

ارزیابی‌های ما نشان داده‌اند که «مدل‌های پایه نظارت» مانند gpt-oss-safeguard-20B و gpt-oss-safeguard-120B می‌توانند شما را به‌سرعت تا حد زیادی پیش ببرند. بااین‌حال، وقتی سیستم‌ها به بالاترین سطح ایمنی و دقت نیاز دارند، مدل‌های تنظیم‌دقیق‌شده برای یک حوزه خاص همچنان معیار برترند.

تصویری از قدرت تنظیم دقیق هدفمند.

برای کاربرد نظارت درون‌بازی، یک طبقه‌بند Qwen3-0.6B را با بهبود تحت نظارت و با استفاده از حدود ۱۰ هزار اقدام پیشین ناظران و نتایج سیاست‌ها تنظیم دقیق کردیم. این مدل در این وظیفه با اختلاف چشمگیری از همه مدل‌های پایه آزمایش‌شده بهتر عمل می‌کند و به دقت ۵۷٪ در برابر ۱۵٪ می‌رسد (برای gpt-oss-safeguard-120B، برآوردشده بر اساس نسبت عملکرد GPT-4.1-nano)؛ یعنی ۴۲ واحد درصد و حدود ۲۸۰٪ بهبود. این نتایج با راهنمایی OpenAI هم‌خوان است که می‌گوید طبقه‌بندهای کوچک و اختصاصیِ آموزش‌دیده با نمونه‌های برچسب‌گذاری‌شده، در حوزه‌های تخصصی می‌توانند از مدل‌های حفاظتی بهتر عمل کنند.

نتیجه روشن است: وقتی سیاست‌ها ظریف‌اند و موارد مرزی فراوانی دارند، یک مدل کوچک و تنظیم‌شده برای همان حوزه همچنان معیار طلایی است. فرایند تنظیم دقیق، سیاست و موارد مرزی شما را مستقیماً در پارامترها تثبیت می‌کند؛ در نتیجه، در محیط آشفته تولید رفتاری باثبات‌تر و درعین‌حال تأخیر و هزینه‌ای ناچیز به دست می‌آید.

بهبود تحت نظارت فقط یکی از چند رویکرد ممکن برای این کار است. همچنین می‌توان از روش‌های آموزشی قدرتمند دیگری مانند یادگیری تقویتی یا تقطیر برخط سیاست برای بهینه‌سازی بیشتر رفتار مدل بهره گرفت.

محدودیت تنظیم دقیق

تنظیم دقیق معمولاً به داده‌های زیادی نیاز دارد. مجموعه‌داده استفاده‌شده برای تنظیم دقیق این طبقه‌بند Qwen3-0.6B به‌صورت دستی توسط ناظران انسانی برچسب‌گذاری شده بود و ازاین‌رو منبعی پاک و طلایی از واقعیت مبنا به شمار می‌رفت.

در بسیاری از پروژه‌ها، ممکن است چنین مزیت داده‌ای ارزشمندی از ابتدا وجود نداشته باشد. بنابراین، معمولاً تنظیم دقیق را نوعی بهینه‌سازی می‌دانیم که می‌تواند در مراحل بعدی چرخه توسعه راهکار انجام شود. پس از تثبیت ساختار راهکار و گردآوری مقداری داده واقعی کاربران، توسعه‌دهندگان می‌توانند برای ارتقای راهکارهای نظارت خود به سراغ تنظیم دقیق هدفمند بروند.

جمع‌بندی

مدل‌های پایه نظارت مانند gpt-oss-safeguard اجزای سازنده جدید و قدرتمندی هستند. آن‌ها می‌توانند طراحی سیستم‌های نظارت را به‌شکلی معنادار ساده‌تر کنند و هم‌زمان تأخیر کاربردهای بلادرنگ را کاهش دهند. با ترکیب آن‌ها با طبقه‌بندهای کوچک و سفارشی می‌توانید سیستمی ایمن‌تر و سریع‌تر بسازید که نسبت به رویکرد مبتنی بر اعلان با مدل‌های بزرگ عمومی، اجزای متحرک کمتری دارد.

اگر امروز در حال راه‌اندازی یا ارتقای نظارت هستید، بهتر است ابتدا با مدل‌هایی مانند gpt-oss-safeguard شروع کنید، عملکرد را بسنجید و هرجا داده‌ها شکافی نشان دادند، بهبودهای هدفمند را با طبقه‌بندهای سفارشیِ مبتنی بر اعلان یا تنظیم‌دقیق‌شده اعمال کنید.

مایلید بیشتر بدانید؟ برای ما پیام بفرستید.

نویسنده

Douglas Adams،‏ Romain Bourboulou،‏ David Jasek،‏ Atharva Tidke