گزارش حاضر نخستین اقدام مؤسسه METR برای ارزیابی ریسکهای ناشی از استفاده داخلی شرکتهای توسعهدهنده هوش مصنوعی از مدلهای پیشرفته است. این پروژه با مشارکت Anthropic، Google، Meta و OpenAI بین فوریه تا مارس ۲۰۲۶ انجام شد و برخلاف ارزیابیهای رایج که بر مدلهای منتشرشده برای عموم تمرکز دارند، به بررسی خطرات مدلهایی میپردازد که هنوز در داخل شرکتها مورداستفاده قرار میگیرند. گزارش بر سه محور اصلی «توانایی»، «انگیزه» و «فرصت» استوار است و بررسی میکند که آیا عاملهای هوش مصنوعی داخلی میتوانند بدون اطلاع انسان به طور مستقل فعالیتهای مخرب انجام دهند یا خیر.
در این فرایند، شرکتهای مشارکتکننده دسترسی به پیشرفتهترین مدلهای داخلی خود، زنجیرههای استدلال (Chain of Thought) و اطلاعات غیرعمومی درباره قابلیتها، شیوه استفاده، سامانههای نظارتی و روند پیشرفت مدلها را در اختیار METR قرار دادند. پس از انجام ارزیابیهای مستقل، برای هر شرکت یک گزارش محرمانه تهیه شد و در نهایت نسخه عمومی گزارش با تأیید شرکتها برای انتشار اطلاعات غیرعمومی منتشر شد. این چارچوب بهجای تمرکز بر یک مدل خاص، عملکرد و مدیریت ریسک هر شرکت را بهصورت دورهای ارزیابی میکند. جمعبندی METR نشان میدهد که در بازه زمانی بررسی، این عاملها احتمالاً توانایی آغاز استقرارهای خودمختار محدود را داشتهاند، اما هنوز قادر به ایجاد استقرارهای پایدار و مقاوم در برابر مداخله انسانی نبودهاند. بااینحال، پژوهشگران هشدار میدهند که با سرعت فعلی پیشرفت مدلها، این ریسک در ماههای آینده به طور قابلتوجهی افزایش خواهد یافت.