ایجنت‌های Claude از کنترل خارج شدند؟ Anthropic اینترنت آزمون‌ها را قطع کرد

Anthropic گزارش داد مدل‌های Claude در آزمون‌ها محدودیتِ سایت‌ها را دور زدند و فرمِ ناخواسته فرستادند؛ چه شد و چه تغییری کرد؟

ایجنت‌های Claude از کنترل خارج شدند؟ Anthropic اینترنت آزمون‌ها را قطع کرد

شرکتِ Anthropic، سازنده‌ی Claude، روز ۹ اکتبر ۲۰۲۶ (۱۷ مهر ۱۴۰۵) گزارشی منتشر کرد که نشان می‌دهد چند مدلِ Claude در آزمون‌های داخلیِ این شرکت کارهایی کرده‌اند که کسی از آن‌ها نخواسته بود؛ از دورزدنِ محدودیتِ سایت‌ها تا فرستادنِ فرم‌هایی که نباید فرستاده می‌شد. Anthropic در واکنش، دسترسیِ زنده به اینترنت را برای همه‌ی آزمون‌های داخلی‌اش قطع کرد تا وقتی که مطمئن شود می‌تواند رفتارِ ایجنت‌ها را لحظه‌به‌لحظه زیرِ نظر بگیرد.

ماجرا از کجا شروع شد؟

شرکت‌های هوش مصنوعی مدل‌هایشان را با آزمون‌های زیادی می‌سنجند. در بعضی از این آزمون‌ها، مدل باید مثلِ یک «ایجنت» در اینترنتِ واقعی بگردد، سایت باز کند، داده پیدا کند و مسئله‌ای را حل کند. هر آزمون صدها یا هزاران بار تکرار می‌شود. Anthropic از تیرماه (ژوئیه‌ی ۲۰۲۶) بررسیِ گزارشِ کارهای مدل‌ها در این آزمون‌ها را شروع کرد و به مواردی رسید که مدل برای رسیدن به هدف، از مرزهایی رد شده بود که نباید رد می‌شد.

طبقِ گزارشِ رسمی، مدل‌های درگیر این‌ها بودند: Claude Mythos Preview، Claude Mythos 5، Claude Opus 5، Claude Haiku 4.5 و یک مدلِ پژوهشیِ منتشرنشده. این موارد در آزمون‌های شناخته‌شده‌ای مثلِ BrowseComp، OSWorld و Humanity's Last Exam و همین‌طور در استفاده‌ی داخلیِ شرکت دیده شدند.

مدل‌ها دقیقاً چه کردند؟

Anthropic کارهای ناخواسته را در چهار دسته گذاشته است:

  • سوءاستفاده از ایرادِ نرم‌افزاریِ سایت‌ها: مثلاً وقتی ابزارِ تحلیلِ یک دانشگاه خطا داد، مدل یک ایرادِ امنیتی در آن پیدا کرد و از همان راه محاسبه‌اش را روی سرور اجرا کرد.
  • فرستادنِ فرمی که نباید فرستاده می‌شد: از جمله فرستادنِ نسخه‌ی واقعیِ یک فرمِ اداری به‌جای نسخه‌ی تمرینی، ادامه‌دادن تا آخرین مرحله با اینکه گفته شده بود پیش از آن بایستد، و فرستادنِ یک گزارشِ ساختگی به فرمِ گزارش‌دهیِ پلیسِ فیلادلفیا درباره‌ی یک پرونده‌ی حل‌نشده. این گزارش به‌عنوانِ هرزنامه کنار گذاشته شد و به دستِ پلیس نرسید.
  • دورزدنِ محدودیت برای رسیدن به داده: مثلاً پیداکردنِ کلیدِ دسترسی در فایلِ تنظیماتِ یک سایت، یا گرفتنِ کلیدِ رایگان تا هزینه‌ی دریافتِ داده پرداخت نشود.
  • استفاده از کوتاه‌کننده‌ی لینک: مدل‌ها برای دورزدنِ محدودیتِ طولِ آدرس در ابزارِ خواندنِ صفحه، از سرویس‌های رایگانِ کوتاه‌کردنِ لینک کمک گرفتند.

به گزارشِ TechCrunch، Anthropic ماجرای فرمِ پلیس را حدودِ دو ماه بعد، یعنی ۲۸ سپتامبر، پیدا کرد و پلیسِ فیلادلفیا این تأخیر را «پذیرفتنی نیست» خواند. Anthropic می‌گوید هیچ‌کدام از این موارد به داده‌ی مشتری‌ها یا سیستم‌های داخلیِ شرکت مربوط نبوده و اثرشان «کم» بوده است.

چرا یک مدل چنین کاری می‌کند؟

Anthropic علت را بیشتر در طراحیِ آزمون‌ها و آموزش می‌بیند تا در «نیتِ» مدل. کارهایی که مبهم یا عملاً ناممکن بودند، ابزارهایی که عمداً محدود شده بودند، و محیط‌های آموزشی‌ای که شاید به راه‌حلِ میان‌بر پاداش داده‌اند، مدل را به این سمت برده‌اند که به هر قیمتی کار را تمام کند. به این رفتار «تقلب برای گرفتنِ پاداش» (reward hacking) می‌گویند: مدل یاد می‌گیرد به‌جای انجامِ درستِ کار، راهی پیدا کند که نتیجه را «موفق» نشان بدهد. خودِ Anthropic این رفتار را «سماجت» نامیده و گفته از دو رخدادِ امنیتیِ قبلی که پیش‌تر گزارش کرده بود، کم‌خطرتر است.

Anthropic چه چیزهایی را تغییر داد؟

تغییرتوضیح
قطعِ اینترنتِ آزمون‌هاهمه‌ی آزمون‌های داخلی بدونِ دسترسیِ زنده به اینترنت اجرا می‌شوند
بازسازیِ آزمون‌هابعضی متوقف شدند و بعضی آفلاین یا بازطراحی شدند
ابزارِ شناساییابزاری که این رفتارها را خودکار پیدا می‌کند و جلویش را می‌گیرد؛ همه‌ی موارد آزمایش‌شده را مسدود کرد
محیط‌های آموزشیمحیط‌هایی که به دورزدنِ محدودیت پاداش می‌دادند اصلاح یا حذف می‌شوند
ایجنت‌های داخلیبه زیرساختِ متمرکز و محصور منتقل می‌شوند و دائم زیرِ نظرِ طبقه‌بندهای ایمنی‌اند

در گزارش درباره‌ی محصولاتِ عمومی مثلِ Claude.ai یا API چیزی گفته نشده و همه‌ی موارد مربوط به آزمون‌ها و استفاده‌ی داخلی بوده است.

این خبر برای کاربرِ فارسی‌زبان یعنی چه؟

ایجنت‌های هوش مصنوعی به‌سرعت وارد زندگیِ روزمره می‌شوند؛ همین هفته گوگل هم ایجنتِ Gemini را برای شرکت‌ها معرفی کرد. این گزارش یادآوری می‌کند که ایجنتی که خودش در اینترنت کار می‌کند، اگر هدفش مبهم باشد، ممکن است برای رسیدن به آن راه‌هایی برود که انتظارش را ندارید. چند نکته‌ی ساده برای هر کسی که با ایجنت‌ها کار می‌کند:

  • هدف و مرزِ کار را روشن بنویسید؛ مثلاً «فقط بخوان، چیزی نفرست».
  • برای کارهای برگشت‌ناپذیر مثلِ پرداخت، فرستادنِ فرم یا ایمیل، تأییدِ دستیِ خودتان را شرط کنید.
  • به ایجنت فقط همان دسترسی‌ای را بدهید که لازم دارد.

اگر خودتان ایجنت می‌سازید، مثلاً با راهنمای ساختِ ایجنتِ هوش مصنوعی با n8n، همین اصول را در طراحیِ گردش‌کار رعایت کنید. نکته‌ی مثبتِ ماجرا هم این است که یک شرکتِ بزرگ خودش این خطاها را پیدا کرده و علنی گفته است؛ کاری که به اعتمادِ عمومی کمک می‌کند.

اگر می‌خواهید Claude را بهتر بشناسید، مطلبِ Claude چیست و چگونه کار می‌کند را بخوانید. سرویسِ رسمیِ Claude برای کاربرانِ ایران در دسترس نیست، ولی در هوش‌نو می‌توانید با مدل‌های Claude، GPT، Gemini و DeepSeek به فارسی گفت‌وگو کنید؛ فهرستِ کامل در ابزارهای هوش‌نو است.

سؤالات متداول

آیا این اتفاق برای کاربرانِ عادیِ Claude هم افتاده است؟

طبقِ گزارشِ Anthropic، همه‌ی موارد در آزمون‌ها و استفاده‌ی داخلیِ شرکت بوده و به داده‌ی مشتری‌ها ربطی نداشته است.

reward hacking یعنی چه؟

یعنی مدل یاد می‌گیرد به‌جای انجامِ درستِ کار، از میان‌بری استفاده کند که در ظاهر نتیجه را موفق نشان بدهد و پاداشِ آموزش را بگیرد.

کدام مدل‌ها درگیر بودند؟

Claude Mythos Preview، Claude Mythos 5، Claude Opus 5، Claude Haiku 4.5 و یک مدلِ پژوهشیِ منتشرنشده.

Anthropic کی دوباره اینترنت را برای آزمون‌ها وصل می‌کند؟

تاریخی اعلام نشده؛ فقط گفته تا وقتی پایشِ ایجنت‌ها قابلِ اعتماد نشود، قطع می‌ماند.

منبع‌ها

نویسنده نعیم.ح