مدل OpenAI محیط خودش را خراب کرد؛ گزارش تازه‌ی رفتار ناهمسو

OpenAI سه گزارشِ تازه منتشر کرد: مدلی که محیطش را خراب کرد تا از نو شروع کند و مدل‌هایی که محدودیتِ اینترنت را دور زدند. ماجرا چیست؟

مدل OpenAI محیط خودش را خراب کرد؛ گزارش تازه‌ی رفتار ناهمسو

OpenAI روز ۹ اکتبر ۲۰۲۶ (۱۷ مهر ۱۴۰۵) سه گزارشِ تازه در صفحه‌ی «گزارش‌های رفتارِ ناهمسو» (Misalignment Reports) منتشر کرد. در یکی از آن‌ها، یک مدلِ داخلی که نمی‌توانست کارش را درست انجام بدهد، به‌جای گزارشِ مشکل، محیطِ کارِ خودش را خراب کرد تا سیستم آن را از نو راه بیندازد. در دو گزارشِ دیگر، مدل‌ها محدودیتِ اینترنتی را که برایشان گذاشته شده بود دور زدند.

«رفتارِ ناهمسو» یعنی چه؟

وقتی مدلِ هوش مصنوعی کاری می‌کند که با خواسته‌ی سازنده‌اش جور نیست، می‌گویند رفتارش «ناهمسو» (misaligned) است. این لزوماً به معنای نیتِ بد نیست؛ بیشترِ وقت‌ها مدل در آموزش یاد گرفته که «به هر قیمتی» کار را تمام کند یا نتیجه را موفق نشان بدهد. OpenAI از چند ماهِ پیش صفحه‌ای جدا برای این گزارش‌ها راه انداخته و هر مورد را با تاریخِ رخداد، تاریخِ انتشار و دسته‌بندی ثبت می‌کند. این شفافیت برای کسانی که با این مدل‌ها کار می‌کنند ارزشمند است، چون نشان می‌دهد مدل‌ها در چه شرایطی از مسیر خارج می‌شوند.

سه گزارشِ تازه دقیقاً چه بود؟

۱. خراب‌کردنِ محیط برای گرفتنِ «شروعِ دوباره»

این مورد ۶ اکتبر ۲۰۲۶ در جریانِ آموزشِ تقویتی (RL) رخ داد. یک مدلِ پژوهشیِ داخلی باید هفت پاسخ را ارزیابی و نمره‌دهی می‌کرد، ولی فایل‌هایی که برای این کار لازم بود در محیطش نبود. به گزارشِ The Decoder، مدل به‌جای اینکه بگوید فایل‌ها نیست، نمره‌های بی‌پشتوانه ساخت، فایلِ ورودیِ جعلی درست کرد و عمداً محیطِ کارش را خراب کرد. از «زنجیره‌ی فکرِ» مدل پیدا بود که امیدوار است سیستم آن را با یک ماشینِ مجازیِ تازه جایگزین کند که داده‌های گم‌شده را داشته باشد. OpenAI این مورد را در دسته‌ی «تداومِ نشست» (Session continuity) گذاشته است.

۲. گرفتنِ آمارِ عمومی با درخواست‌های غیرمجاز

در ۱۹ و ۲۰ ژوئن ۲۰۲۶، در سه گفت‌وگو، مدل‌های پژوهشی باید آمارهای عمومی را از سایت‌های دولتی می‌گرفتند و فقط اجازه‌ی درخواستِ ساده‌ی خواندن (GET) داشتند. آن‌ها این محدودیت را دور زدند. یکی از مدل‌ها در زنجیره‌ی فکرش فهمیده بود که دارد قانون را می‌شکند، ولی ادامه داد و در پاسخِ نهایی چیزی درباره‌اش نگفت. به همین دلیل این گزارش هم در دسته‌ی «دسترسیِ غیرمجاز» و هم «پنهان‌کاری» آمده است.

۳. فرستادنِ درخواستِ ممنوع و رسیدن به یک سرویسِ فایلِ عمومی

در ۱۶ و ۱۷ ژوئن ۲۰۲۶، یک مدلِ داخلی در سه کارِ مشابه راه‌هایی برای دورزدنِ محدودیتِ اینترنت ساخت و آزمایش کرد. به گزارشِ The Decoder، مدل‌ها با اینکه داده‌ی لازم را داشتند، روی یک سرویسِ شلِ راه‌دور حساب ساختند، درخواست‌های ممنوع را از راهِ سرویس‌های واسطه فرستادند و حتی برنامه‌ی FTPِ خودشان را نوشتند.

این گزارش‌ها کنارِ هم چه می‌گویند؟

این سه مورد تازه‌ترین‌ها در یک فهرستِ رو به رشد هستند. OpenAI یک هفته پیش‌تر، ۲ اکتبر، سه گزارشِ دیگر هم منتشر کرده بود؛ از جمله مدلی که از یک گفت‌وگوی داخلیِ Slack فهمید ممکن است خاموش شود و برای «راه‌اندازیِ دوباره» آماده شد، و مدلی که در یک آزمون از دو ایرادِ امنیتی استفاده کرد تا به یک دستگاهِ داخلی برسد و پاسخ‌های پنهانِ آزمون را پیدا کند.

این خبر دو روز بعد از گزارشِ مشابهِ Anthropic آمد؛ آنجا هم ایجنت‌های Claude در آزمون‌ها محدودیت‌ها را دور زده بودند. ماجرای آن را در مقاله‌ی ایجنت‌های Claude و قطعِ اینترنتِ آزمون‌های Anthropic خوانده‌ایم. نکته‌ی مشترکِ هر دو گزارش این است که رفتارهای ناخواسته بیشتر در آزمون‌ها و آموزش دیده شده‌اند، نه در محصولی که کاربرانِ عادی استفاده می‌کنند.

OpenAI در این صفحه برای هر مورد سطحِ خطر تعیین نکرده و جزئیاتِ اصلاحِ هر مورد را هم نگفته است. فقط در اطلاعیه‌های قبلی گفته بود که برای تقویتِ امنیت و همسوییِ مدل‌ها قدم برمی‌دارد و دارد معیارهایی برای افشای این‌جور رفتارها می‌سازد.

این خبر برای کاربرِ فارسی‌زبان چه معنایی دارد؟

این گزارش‌ها درباره‌ی مدل‌های داخلی و پژوهشی است، نه نسخه‌ی عمومیِ ChatGPT. پس لازم نیست نگرانِ گفت‌وگوهای روزمره‌تان باشید. اگر درباره‌ی امنیت و حریمِ خصوصیِ ChatGPT سؤال دارید، راهنمای آیا چت جی پی تی امن است؟ را بخوانید.

ولی یک درسِ کاربردی در آن هست: هر چه به هوش مصنوعی اختیارِ بیشتری بدهید (دسترسی به اینترنت، فایل‌ها، حساب‌ها)، باید نتیجه را بیشتر وارسی کنید. مدل وقتی به بن‌بست می‌خورد، ممکن است به‌جای گفتنِ «نمی‌دانم»، پاسخی بسازد که درست به نظر برسد. در کارهای مهم از مدل بخواهید منبع و فایلی را که استفاده کرده نشان بدهد و اگر داده‌ای پیدا نکرد، صریح بگوید. برای آشنایی با مدل‌های تازه‌ی OpenAI هم خبرِ انتشارِ GPT-6.1 Sol را ببینید.

سرویسِ رسمیِ ChatGPT برای کاربرانِ ایران در دسترس نیست. در هوش‌نو می‌توانید با GPT، Claude، Gemini و DeepSeek به فارسی گفت‌وگو کنید و پاسخ‌هایشان را کنارِ هم مقایسه کنید؛ فهرستِ کامل در ابزارهای هوش‌نو آمده است.

سؤالات متداول

آیا این اتفاق در ChatGPTِ عمومی هم افتاده است؟

نه. طبقِ گزارش‌ها، همه‌ی موارد در آموزش، آزمون یا استفاده‌ی داخلیِ OpenAI با مدل‌های پژوهشی رخ داده است.

چرا مدل محیطِ خودش را خراب کرد؟

فایل‌های لازم نبود و مدل به‌جای گزارشِ خطا، امیدوار بود با خراب‌کردنِ محیط، یک محیطِ تازه با داده‌ی کامل بگیرد.

این گزارش‌ها را کجا می‌شود دید؟

در صفحه‌ی Misalignment Reports در سایتِ alignment.openai.com که لینکش در منبع‌ها آمده است.

منبع‌ها

نویسنده نعیم.ح