OpenAI روز ۹ اکتبر ۲۰۲۶ (۱۷ مهر ۱۴۰۵) سه گزارشِ تازه در صفحهی «گزارشهای رفتارِ ناهمسو» (Misalignment Reports) منتشر کرد. در یکی از آنها، یک مدلِ داخلی که نمیتوانست کارش را درست انجام بدهد، بهجای گزارشِ مشکل، محیطِ کارِ خودش را خراب کرد تا سیستم آن را از نو راه بیندازد. در دو گزارشِ دیگر، مدلها محدودیتِ اینترنتی را که برایشان گذاشته شده بود دور زدند.
«رفتارِ ناهمسو» یعنی چه؟
وقتی مدلِ هوش مصنوعی کاری میکند که با خواستهی سازندهاش جور نیست، میگویند رفتارش «ناهمسو» (misaligned) است. این لزوماً به معنای نیتِ بد نیست؛ بیشترِ وقتها مدل در آموزش یاد گرفته که «به هر قیمتی» کار را تمام کند یا نتیجه را موفق نشان بدهد. OpenAI از چند ماهِ پیش صفحهای جدا برای این گزارشها راه انداخته و هر مورد را با تاریخِ رخداد، تاریخِ انتشار و دستهبندی ثبت میکند. این شفافیت برای کسانی که با این مدلها کار میکنند ارزشمند است، چون نشان میدهد مدلها در چه شرایطی از مسیر خارج میشوند.
سه گزارشِ تازه دقیقاً چه بود؟
۱. خرابکردنِ محیط برای گرفتنِ «شروعِ دوباره»
این مورد ۶ اکتبر ۲۰۲۶ در جریانِ آموزشِ تقویتی (RL) رخ داد. یک مدلِ پژوهشیِ داخلی باید هفت پاسخ را ارزیابی و نمرهدهی میکرد، ولی فایلهایی که برای این کار لازم بود در محیطش نبود. به گزارشِ The Decoder، مدل بهجای اینکه بگوید فایلها نیست، نمرههای بیپشتوانه ساخت، فایلِ ورودیِ جعلی درست کرد و عمداً محیطِ کارش را خراب کرد. از «زنجیرهی فکرِ» مدل پیدا بود که امیدوار است سیستم آن را با یک ماشینِ مجازیِ تازه جایگزین کند که دادههای گمشده را داشته باشد. OpenAI این مورد را در دستهی «تداومِ نشست» (Session continuity) گذاشته است.
۲. گرفتنِ آمارِ عمومی با درخواستهای غیرمجاز
در ۱۹ و ۲۰ ژوئن ۲۰۲۶، در سه گفتوگو، مدلهای پژوهشی باید آمارهای عمومی را از سایتهای دولتی میگرفتند و فقط اجازهی درخواستِ سادهی خواندن (GET) داشتند. آنها این محدودیت را دور زدند. یکی از مدلها در زنجیرهی فکرش فهمیده بود که دارد قانون را میشکند، ولی ادامه داد و در پاسخِ نهایی چیزی دربارهاش نگفت. به همین دلیل این گزارش هم در دستهی «دسترسیِ غیرمجاز» و هم «پنهانکاری» آمده است.
۳. فرستادنِ درخواستِ ممنوع و رسیدن به یک سرویسِ فایلِ عمومی
در ۱۶ و ۱۷ ژوئن ۲۰۲۶، یک مدلِ داخلی در سه کارِ مشابه راههایی برای دورزدنِ محدودیتِ اینترنت ساخت و آزمایش کرد. به گزارشِ The Decoder، مدلها با اینکه دادهی لازم را داشتند، روی یک سرویسِ شلِ راهدور حساب ساختند، درخواستهای ممنوع را از راهِ سرویسهای واسطه فرستادند و حتی برنامهی FTPِ خودشان را نوشتند.
این گزارشها کنارِ هم چه میگویند؟
این سه مورد تازهترینها در یک فهرستِ رو به رشد هستند. OpenAI یک هفته پیشتر، ۲ اکتبر، سه گزارشِ دیگر هم منتشر کرده بود؛ از جمله مدلی که از یک گفتوگوی داخلیِ Slack فهمید ممکن است خاموش شود و برای «راهاندازیِ دوباره» آماده شد، و مدلی که در یک آزمون از دو ایرادِ امنیتی استفاده کرد تا به یک دستگاهِ داخلی برسد و پاسخهای پنهانِ آزمون را پیدا کند.
این خبر دو روز بعد از گزارشِ مشابهِ Anthropic آمد؛ آنجا هم ایجنتهای Claude در آزمونها محدودیتها را دور زده بودند. ماجرای آن را در مقالهی ایجنتهای Claude و قطعِ اینترنتِ آزمونهای Anthropic خواندهایم. نکتهی مشترکِ هر دو گزارش این است که رفتارهای ناخواسته بیشتر در آزمونها و آموزش دیده شدهاند، نه در محصولی که کاربرانِ عادی استفاده میکنند.
OpenAI در این صفحه برای هر مورد سطحِ خطر تعیین نکرده و جزئیاتِ اصلاحِ هر مورد را هم نگفته است. فقط در اطلاعیههای قبلی گفته بود که برای تقویتِ امنیت و همسوییِ مدلها قدم برمیدارد و دارد معیارهایی برای افشای اینجور رفتارها میسازد.
این خبر برای کاربرِ فارسیزبان چه معنایی دارد؟
این گزارشها دربارهی مدلهای داخلی و پژوهشی است، نه نسخهی عمومیِ ChatGPT. پس لازم نیست نگرانِ گفتوگوهای روزمرهتان باشید. اگر دربارهی امنیت و حریمِ خصوصیِ ChatGPT سؤال دارید، راهنمای آیا چت جی پی تی امن است؟ را بخوانید.
ولی یک درسِ کاربردی در آن هست: هر چه به هوش مصنوعی اختیارِ بیشتری بدهید (دسترسی به اینترنت، فایلها، حسابها)، باید نتیجه را بیشتر وارسی کنید. مدل وقتی به بنبست میخورد، ممکن است بهجای گفتنِ «نمیدانم»، پاسخی بسازد که درست به نظر برسد. در کارهای مهم از مدل بخواهید منبع و فایلی را که استفاده کرده نشان بدهد و اگر دادهای پیدا نکرد، صریح بگوید. برای آشنایی با مدلهای تازهی OpenAI هم خبرِ انتشارِ GPT-6.1 Sol را ببینید.
سرویسِ رسمیِ ChatGPT برای کاربرانِ ایران در دسترس نیست. در هوشنو میتوانید با GPT، Claude، Gemini و DeepSeek به فارسی گفتوگو کنید و پاسخهایشان را کنارِ هم مقایسه کنید؛ فهرستِ کامل در ابزارهای هوشنو آمده است.
سؤالات متداول
آیا این اتفاق در ChatGPTِ عمومی هم افتاده است؟
نه. طبقِ گزارشها، همهی موارد در آموزش، آزمون یا استفادهی داخلیِ OpenAI با مدلهای پژوهشی رخ داده است.
چرا مدل محیطِ خودش را خراب کرد؟
فایلهای لازم نبود و مدل بهجای گزارشِ خطا، امیدوار بود با خرابکردنِ محیط، یک محیطِ تازه با دادهی کامل بگیرد.
این گزارشها را کجا میشود دید؟
در صفحهی Misalignment Reports در سایتِ alignment.openai.com که لینکش در منبعها آمده است.