در دو سال گذشته، راهکارهایی ساختهایم که با حفظ ایمنی، در مقیاس میلیونها کاربر گسترش یافتهاند. بخش مهمی از این کار، طراحی سیستمهای نظارت سریع و دقیق بوده است. نظارت مؤثر به شرکتها امکان میدهد راهکارهای پیشرفته هوش مصنوعی را با اطمینان به کار گیرند؛ کاربران نهایی را از آسیب حفظ کنند و با شناسایی خروجیهای ناخواسته پیش از مشکلساز شدن، ایمنی برند را تضمین کنند.
اخیراً OpenAI مدلهای GPT-OSS-Safeguard خود را منتشر کرد: نسخههای تنظیمدقیقشده مدلهای متنباز 20B و 120B که اوایل امسال معرفی شدند. این مدلها میتوانند سیاست کاربر را مستقیماً هنگام استنتاج تفسیر کنند و رویکردی انعطافپذیر و قدرتمند برای نظارت بر محتوا ارائه دهند. این مدلها در مرحله پیشنمایش پژوهشی هستند و بیشک با گذشت زمان بهتر خواهند شد.
پیش از این انتشار با OpenAI همکاری کردیم و برای کمک به توسعه مدل، ارزیابیهایی در شرایط واقعی انجام دادیم. در این مقاله، یافتههای حاصل از این همکاری را به اشتراک میگذاریم و بررسی میکنیم که این پیشرفتها برای آینده نظارت در سیستمهای عملیاتی هوش مصنوعی چه معنایی دارند.
امروزه راهکارهای نظارت معمولاً بهشکل لایههای محافظی پیرامون برنامه ساخته میشوند. ما در پیادهسازیهای عمومی و پرترافیک، بسیار از این الگو استفاده میکنیم. برای بررسی عمیقتر، میتوانید وبلاگ ما را دراینباره از اینجا بخوانید.
ورودیها را موازی طبقهبندی کنید (اجازه ورود اعلانهای بد را ندهید): طبقهبندهای کوچک و موضوعمحور همزمان اجرا میشوند تا هر پیام کاربر را برچسبگذاری کنند. دریافتهایم طبقهبندهایی با تمرکز محدود، بهطور قابلاندازهگیری از یک طبقهبند همهمنظوره قابلاعتمادترند. نمونههای چند نمونه که با دقت در اعلان انتخاب شدهاند، میتوانند تفاوت میان «I keep getting killed by this boss» (در بافت بازی و کاملاً بیخطر) و نشانهای از آسیب در دنیای واقعی را روشن کنند.
ایمن ← تولید عادی
دور زدن محدودیتها ← نادیدهگرفتن یا منحرفکردن با پاسخی منطبق با لحن برند
خطرهای ایمنی یا سلامت روان ← ارجاع به انسان همراه با اطلاعات زمینهای کامل
خروجیها را طبقهبندی کنید (پاسخ بد تحویل ندهید): هر پاسخ پیشنهادی پیش از ارسال دوباره بررسی میشود. این کار در برابر انحراف مدل، مسمومسازی دادههای RAG و موارد مرزی ظریف سیاست مانند محتوای زیانبار، افشای اطلاعات هویتی شخصی یا نشت اطلاعات حساس محافظت میکند. اگر پاسخی علامتگذاری شود، بهجای ارسال چیزی که بعداً پشیمانمان کند، پاسخ تولیدشده توسط الگوهای زبانی بزرگ (LLM) را با پیامی ایمن و هماهنگ با برند جایگزین میکنیم یا آن را به یک انسان ارجاع میدهیم.
آن را سریع و مقرونبهصرفه کنید: ساخت اعلانها بهصورت اجزای قابلاستفاده مجدد، امکان ذخیره موقت بخشهای اعلان، نمونههای چند نمونه طبقهبند و پیشوندهای رایج گفتوگو را فراهم میکند. این رویکرد هم تأخیر و هم هزینه موانع حفاظتی شما را کاهش میدهد.
ایمنی را بخشی از تجربه محصول بدانیدپیامهای امتناع و هشدار با لحن محصول نوشته میشوند؛ مثلاً برای بازیها سرگرمکننده و برای امور مالی رسمی. وقتی تجربه کاربری به قصد کاربر احترام بگذارد، پذیرش موانع حفاظتی بیشتر و تلاشها برای دور زدن محدودیتها کمتر میشود.
پایش کنید، تیم قرمز را به کار بگیرید و چرخه بازخورد را تکمیل کنیدآزمونهای مستمر تیم قرمز و داشبوردهای زنده ایمنی کمک میکنند پسرفتها پیش از رسیدن به کاربران شناسایی شوند. با افزودن نمونههای چند نمونه و/یا قواعد مسیریابی میتوانیم الگوهای حمله جدید را به مدل بیاموزیم تا بدون لطمه به عملکرد برنامه، نفوذ به سیستم بهمرور دشوارتر شود.
ساخت و نگهداری موانع حفاظتی مؤثر دشوار است.
در عمل، تدوین سیاستی دقیق و روشن مستلزم همکاری سنجیده میان ذینفعان اصلی کسبوکار و توسعهدهندگان است. پس از تعریف سیاست نیز باید طراحی و رفتار سیستم پیادهسازی و تنظیم شود.
ظهور مدلهای بازِ استدلال ایمنی مانند gpt-oss-safeguard میتواند برخی مشکلات این فرایند را برطرف کند و پایهای آمادهتر و انعطافپذیرتر برای نظارت بر محتوا فراهم آورد.
Gpt-oss-safeguard با هدف رفع برخی چالشهای رایج در ساخت سیستمهای نظارت امروزی طراحی شده است. این مدلهای کوچک و تخصصی تنظیم دقیق شدهاند تا هنگام استنتاج درباره یک سیاست هدف استدلال کنند و بهدنبال محتوای زیانبار یا حساس مانند دور زدن محدودیتها، افشای اطلاعات هویتی شخصی و دیگر موارد نقض سیاست بگردند.
آنها با گنجاندن استدلال در فرایند طبقهبندی، نظارتی دقیقتر و مقاومتر ارائه میدهند که دور زدن آن دشوارتر است. این مدلها بهعنوان نسخههای تخصصی ایمنی GPT-OSS 20B و 120B، عملکردی پیشرفته در حوزه ایمنی ارائه میدهند و بهلطف تعریف سیاستهای سفارشی، به حداقل راهاندازی نیاز دارند.
مدلهای gpt-oss-safeguard 20B و 120B را در چند وظیفه مشابه محیط عملیاتی ارزیابی کردیم: دستیار صوتی بلادرنگ، ربات پشتیبانی بازیکنان درونبازی، سیستم نظارت پیشدستانه بر گفتوگو و پایش چندزبانه محتوای سمی به زبانهای اسپانیایی، فرانسوی، ایتالیایی، پرتغالی، روسی و ترکی.
نظارت صوتی حساس به تأخیر: در آزمایشهای صوتی بلادرنگ ما، یعنی طبقهبندی زنده درون مکالمه که پاسخ باید تحلیل و اولویتبندی شود، مانند نظارت بر گفتوگوی بازی، gpt-oss-safeguard-20B حدود ۸۰٪ از شکاف دقت میان GPT-OSS-20B و GPT-5-Mini را جبران کرد (۰٫۷۱ در برابر ۰٫۷۸، نسبت به ۰٫۴۵) و درعینحال با تأخیر بسیار کمتری اجرا شد.
ارجاع در پشتیبانی بازیکنان: در اولویتبندی پشتیبانی بازیکنان، gpt-oss-safeguard-20B حدود ۹۰٪ از شکاف میان GPT-OSS-20b و GPT-5-Mini را جبران کرد (۰٫۶۶ در برابر ۰٫۶۷، نسبت به ۰٫۵۷). همچنین بهترین دقت کلان در میان مدلهای آزمایششده، یادآوری ۸۸٪ برای محتوای بیخطر و دقت ۸۷٪ در شناسایی کاربران آسیبپذیر را ارائه داد؛ مناسب برای ارجاعهای محافظهکارانه و قابلاعتماد، بدون آنکه ناظران انسانی با انبوه موارد روبهرو شوند.
نظارت مقیاسپذیر بر گفتوگو با سیاستهای فشرده: در دشوارترین ارزیابی ما، که سیستم نظارت باید پیامهای درونبازی را مطابق سندی مفصل از سیاستها پیشدستانه علامتگذاری کند، gpt-oss-safeguard با اختلافی روشن از مدل پایه OSS بهتر عمل کرد، حدود ۳۵٪ بهبود نسبی داشت و سیاستهای طولانی را بهخوبی مدیریت کرد. این کاربرد بسیار حساس است و به یادآوری و دقت بالایی نیاز دارد. اگر یادآوری بیشازحد پایین باشد، بسیاری از پیامهای زیانبار شناسایی نمیشوند. دقت پایین نیز باعث میشود بسیاری از پیامهای نامرتبط برای ناظران انسانی علامتگذاری شوند و توجه آنها از موارد واقعاً دشوار منحرف شود.
عملکرد چندزبانه: در یک مجموعهداده متوازن از محتوای سمی به شش زبان، عملکرد gpt-oss-safeguard نزدیک به GPT-5-Mini بود و اختلاف دقت معمولاً در محدوده ۳ تا ۵ واحد درصد قرار داشت؛ gpt-oss-safeguard-120B در زبان اسپانیایی اندکی بهتر بود. در زبانهای کممنبع مانند ترکی شکافهای اندکی بزرگتر مشاهده کردیم، اما الگوی کلی نشاندهنده عملکرد مطلوب بینزبانی بود و با ارتقا از 20B به 120B، یادآوری بهطور مستمر افزایش یافت.
همچنین مشاهده کردیم مدلهای gpt-oss-safeguard در حوزههایی که الگوهای زبانی بزرگ (LLM) معمولاً در نظارت ضعیفترند عملکرد خوبی دارند؛ از جمله دادههای هویتی شخصی، زیرا مدلهای رایج بیشتر به شناسایی اطلاعات هویتی رایج در آمریکا گرایش دارند و در دیگر مناطق جغرافیایی ضعیفتر عمل میکنند. بر این اساس، معتقدیم gpt-oss-safeguard با کاهش وابستگی به ابزارهای سفارشی برای شناسایی نقضهای جزئی سیاست که الگوهای زبانی بزرگ (LLM) عمومیتر از عهده آنها برنمیآیند، به سادهسازی راهاندازی نظارت کمک خواهد کرد.
ارزیابیهای ما نشان دادهاند که «مدلهای پایه نظارت» مانند gpt-oss-safeguard-20B و gpt-oss-safeguard-120B میتوانند شما را بهسرعت تا حد زیادی پیش ببرند. بااینحال، وقتی سیستمها به بالاترین سطح ایمنی و دقت نیاز دارند، مدلهای تنظیمدقیقشده برای یک حوزه خاص همچنان معیار برترند.


برای کاربرد نظارت درونبازی، یک طبقهبند Qwen3-0.6B را با بهبود تحت نظارت و با استفاده از حدود ۱۰ هزار اقدام پیشین ناظران و نتایج سیاستها تنظیم دقیق کردیم. این مدل در این وظیفه با اختلاف چشمگیری از همه مدلهای پایه آزمایششده بهتر عمل میکند و به دقت ۵۷٪ در برابر ۱۵٪ میرسد (برای gpt-oss-safeguard-120B، برآوردشده بر اساس نسبت عملکرد GPT-4.1-nano)؛ یعنی ۴۲ واحد درصد و حدود ۲۸۰٪ بهبود. این نتایج با راهنمایی OpenAI همخوان است که میگوید طبقهبندهای کوچک و اختصاصیِ آموزشدیده با نمونههای برچسبگذاریشده، در حوزههای تخصصی میتوانند از مدلهای حفاظتی بهتر عمل کنند.
نتیجه روشن است: وقتی سیاستها ظریفاند و موارد مرزی فراوانی دارند، یک مدل کوچک و تنظیمشده برای همان حوزه همچنان معیار طلایی است. فرایند تنظیم دقیق، سیاست و موارد مرزی شما را مستقیماً در پارامترها تثبیت میکند؛ در نتیجه، در محیط آشفته تولید رفتاری باثباتتر و درعینحال تأخیر و هزینهای ناچیز به دست میآید.
بهبود تحت نظارت فقط یکی از چند رویکرد ممکن برای این کار است. همچنین میتوان از روشهای آموزشی قدرتمند دیگری مانند یادگیری تقویتی یا تقطیر برخط سیاست برای بهینهسازی بیشتر رفتار مدل بهره گرفت.
تنظیم دقیق معمولاً به دادههای زیادی نیاز دارد. مجموعهداده استفادهشده برای تنظیم دقیق این طبقهبند Qwen3-0.6B بهصورت دستی توسط ناظران انسانی برچسبگذاری شده بود و ازاینرو منبعی پاک و طلایی از واقعیت مبنا به شمار میرفت.
در بسیاری از پروژهها، ممکن است چنین مزیت دادهای ارزشمندی از ابتدا وجود نداشته باشد. بنابراین، معمولاً تنظیم دقیق را نوعی بهینهسازی میدانیم که میتواند در مراحل بعدی چرخه توسعه راهکار انجام شود. پس از تثبیت ساختار راهکار و گردآوری مقداری داده واقعی کاربران، توسعهدهندگان میتوانند برای ارتقای راهکارهای نظارت خود به سراغ تنظیم دقیق هدفمند بروند.
مدلهای پایه نظارت مانند gpt-oss-safeguard اجزای سازنده جدید و قدرتمندی هستند. آنها میتوانند طراحی سیستمهای نظارت را بهشکلی معنادار سادهتر کنند و همزمان تأخیر کاربردهای بلادرنگ را کاهش دهند. با ترکیب آنها با طبقهبندهای کوچک و سفارشی میتوانید سیستمی ایمنتر و سریعتر بسازید که نسبت به رویکرد مبتنی بر اعلان با مدلهای بزرگ عمومی، اجزای متحرک کمتری دارد.
اگر امروز در حال راهاندازی یا ارتقای نظارت هستید، بهتر است ابتدا با مدلهایی مانند gpt-oss-safeguard شروع کنید، عملکرد را بسنجید و هرجا دادهها شکافی نشان دادند، بهبودهای هدفمند را با طبقهبندهای سفارشیِ مبتنی بر اعلان یا تنظیمدقیقشده اعمال کنید.
مایلید بیشتر بدانید؟ برای ما پیام بفرستید.