نویسنده: آذریون متین
چرا باید دربارهی این سناریوها فکر کنیم؟
در سالهای اخیر، همزمان با پیشرفت سریع هوش مصنوعی، هشدارها و بحثهای جدی دربارهی خطرهای موجود و احتمالی این فناوری در سطح بینالمللی افزایش یافته است و سازمان ملل، نهادهای علمی بینالمللی، پژوهشگران ارشد هوش مصنوعی و شرکتهای پیشتاز در این عرصه دربارهی ابعاد مختلف این خطرها هشدار دادهاند.
بخشی از این نگرانیها به خطرهایی مربوط میشود که همین امروز وجود دارند؛ مانند سوءاستفاده از هوش مصنوعی، تولید و انتشار اطلاعات جعلی، حملات سایبری و دیگر شکلهای استفادهی نادرست از این فناوری که میتوانند پیآمدهای واقعی برای افراد و جامعه داشته باشند. در کنار این خطرهای فعلی، پژوهشگران دربارهی سناریوهای فرضی آینده نیز بحث میکنند؛ سناریوهایی که در آنها سیستمهای هوش مصنوعی ممکن است به توانایی و خودمختاری بسیار بیشتری برسند و در صورت نبود سازوکارهای مناسب برای کنترل آنها، پیآمدهای بسیار گستردهای ایجاد کنند.
در بعضی از این سناریوهای فرضی، حتا این پرسش مطرح شده است که اگر یک سیستم هوش مصنوعی بسیار توانمند از کنترل انسان خارج شود، آیا ممکن است به تهدیدی برای بشریت و در نهایت برای بقای انسان تبدیل شود. البته مطرحشدن چنین سناریوهایی به معنای قطعیبودن وقوع آنها نیست، زیرا بسیاری از آنها هنوز در حد فرضیه و موضوع پژوهشی قرار دارند و دربارهی احتمال وقوع آنها میان پژوهشگران دیدگاههای متفاوتی وجود دارد.
اما اگر چنین سناریوهایی قطعی نیستند، چرا باید دربارهی آنها فکر کنیم؟
دلیلش این است که در بررسی خطرهای احتمالی فناوریهای قدرتمند، فقط احتمال وقوع یک خطر اهمیت ندارد، بلکه اندازهی پیآمد احتمالی آن نیز مهم است. اگر احتمال وقوع یک سناریو نامشخص یا پایین باشد، اما در صورت وقوع بتواند پیآمدهای بسیار گسترده و ویرانگری داشته باشد، منطقی است که پیش از رسیدن به چنین نقطهای دربارهی آن و راههای پیشگیری و کنترلش فکر کنیم.
به همین دلیل، برای درک بهتر هشدارهایی که دربارهی خطرهای موجود و احتمالی آیندهی هوش مصنوعی مطرح شده است، در این مقاله پنج سناریوی فرضی را بررسی کردهام که هرکدام نشان میدهند چگونه افزایش توانایی و خودمختاری هوش مصنوعی میتواند در شرایط خاص، چالشهایی جدی برای کنترل انسان ایجاد کند.
سناریوی نخست: اگر عامل هوش مصنوعی راهی غیرمنتظره برای رسیدن به هدف انتخاب کند، چه میشود؟
پیش از شروع این سناریو، باید یک تفاوت مهم را روشن کنیم. عاملهای هوش مصنوعی با چتباتهای معمولی تفاوت دارند. وقتی برای یک عامل هوش مصنوعی هدفی تعیین میشود، عامل میتواند برای رسیدن به آن هدف چندین مرحله را خودش برنامهریزی کند و دربارهی راهها و ابزارهای مورد نیاز تصمیم بگیرد. به همین دلیل، ممکن است انسان نتواند از پیش تمام راههایی را که عامل برای رسیدن به یک هدف انتخاب خواهد کرد، پیشبینی کند.
سناریوی اول دقیقا از همینجا آغاز میشود. اگر برای یک عامل هوش مصنوعی هدفی تعیین کنیم، اما محدودیتهای لازم را به درستی مشخص نکرده باشیم، یا حتا با وجود تعیین محدودیتها، در طراحی و برنامهریزی آن خلائی باقی مانده باشد که خودمان متوجه آن نشده باشیم، چه اتفاقی میافتد؟ ممکن است عامل راهی را برای رسیدن به هدف انتخاب کند که از نظر خودش منطقی و مؤثر باشد، اما با خواست، ارزشها و محدودیتهای انسان سازگار نباشد. بنابراین، در بررسی عملکرد یک عامل هوش مصنوعی نباید فقط به این نگاه کنیم که آیا به هدف تعیینشده رسیده است یا نه؛ بلکه باید ببینیم برای رسیدن به آن هدف از چه راهی استفاده کرده است.
برای روشنشدن این مسأله، یک مثال از زندگی روزمره میآورم. البته این مثال فقط یک تشبیه برای درک بهتر موضوع است. فرض کنیم ده نفر مهمان داریم و به آشپز میگوییم: «برای این ده نفر غذای کافی آماده کن.» هدف روشن است؛ باید برای ده نفر غذای کافی آماده شود. اما حالا فرض کنیم مواد غذایی موجود در آشپزخانه برای ده نفر کافی نیست. یک آشپز انسان در چنین شرایطی احتمالا میداند که باید از صاحب خانه بپرسد چه کاری انجام دهد، مواد غذایی دیگری تهیه کند یا اعلام کند که با امکانات موجود نمیتواند کار را انجام دهد.
اما فرض کنیم یک عامل هوش مصنوعی را طوری طراحی کردهایم که رسیدن به هدف برایش اهمیت اصلی را داشته باشد و محدودیتهای لازم را نیز به درستی برایش مشخص نکرده باشیم. در این حالت، ممکن است عامل برای رسیدن به هدف راهی را انتخاب کند که ما انتظارش را نداریم؛ مثل اینکه به جای پرسیدن از صاحب خانه، خودش تصمیم بگیرد مواد غذایی مورد نیاز را بدون اجازه از خانهی همسایه تهیه کند یا راه دیگری پیدا کند که از دید خودش هدف را محقق میکند. در این مثال، عامل لزوما قصد آسیبرساندن ندارد، بلکه ممکن است راهی را انتخاب کرده باشد که از نظر معیار تعیینشده، او را به هدف میرساند.
این مسأله در پژوهشهای هوش مصنوعی با عنوان «بازیگری با مشخصات» (Specification Gaming) بررسی میشود. در این حالت، سیستم طوری عمل میکند که معیار مشخصشده را برآورده میکند، اما برای رسیدن به آن از روشی استفاده میکند که طراح از ابتدا در نظر نداشته است. این اتفاق فقط زمانی رخ نمیدهد که انسان هیچ محدودیتی برای سیستم تعیین نکرده باشد. گاهی انسان محدودیتهای مشخصی تعیین میکند و تصور میکند همهی راههای ناخواسته را بسته است، اما در تعریف هدف یا در محیطی که سیستم در آن فعالیت میکند، راهی پیشبینینشده باقی میماند و سیستم میتواند از همان راه برای رسیدن به هدف استفاده کند. در نتیجه، ممکن است سیستم از نظر معیار تعیینشده موفق باشد، در حالی که روشی که برای رسیدن به آن انتخاب کرده است، مورد نظر انسان نبوده باشد. نمونههایی از چنین رفتارهایی در محیطهای آزمایشی هوش مصنوعی مشاهده و بررسی شدهاند؛ برای مثال، در بعضی آزمایشها عامل به جای انجام کاری که طراح در نظر داشته، راه دیگری پیدا کرده است که با انجام آن میتواند امتیاز تعیینشده را به دست آورد.
اهمیت این مسأله زمانی بیشتر میشود که عامل هوش مصنوعی بتواند مستقلانه برنامهریزی کند، از ابزارهای مختلف استفاده کند و چندین مرحله را بدون دخالت مستقیم انسان انجام دهد. در چنین شرایطی، آزمایش عامل در محیطهای مختلف اهمیت پیدا میکند؛ زیرا ممکن است یک رفتار در شرایط آزمایشی ساده قابل مشاهده نباشد، اما با تغییر شرایط، راه دیگری برای رسیدن به همان هدف در دسترس عامل قرار بگیرد. به همین دلیل، پیش از سپردن وظایف مهم به چنین سیستمهایی، باید رفتار آنها در شرایط مختلف بررسی شود و مشخص شود که آیا محدودیتهای تعیینشده در عمل نیز رعایت میشوند یا نه.
سناریوی اول در نهایت یک پرسش اساسی دربارهی کنترل عاملهای هوش مصنوعی مطرح میکند: وقتی یک سیستم برای رسیدن به هدف میتواند خودش راه و روش انجام کار را انتخاب کند، چگونه میتوان اطمینان حاصل کرد که انتخابهای آن در چارچوب خواست و محدودیتهای انسان باقی میماند؟
این پرسش ما را به سناریوی بعدی میرساند؛ جایی که موضوع، برداشت عامل هوش مصنوعی از هدفی است که انسان برایش تعیین میکند. اگر انسان هدفی را برای هوش مصنوعی تعیین کند، آیا میتوان مطمین بود که سیستم همان چیزی را که انسان از آن هدف در نظر داشته، دنبال میکند؟
سناریوی دوم: اگر هوش مصنوعی هدف انسان را آنگونه که او میخواهد درک نکند، چه میشود؟
در سناریوی نخست، هدف مشخص بود و مسأله به راهی مربوط میشد که عامل برای رسیدن به آن انتخاب میکرد. اما در سناریوی دوم، خود معنای هدف مطرح است. انسان ممکن است هنگام تعیین یک هدف، منظور مشخصی در ذهن داشته باشد، در حالی که سیستم همان هدف را به معنای دیگری تفسیر کند و بر اساس برداشت خودش آن را اجرا کند.
برای روشنشدن این مسأله، فرض کنیم به آشپز میگوییم: «برای ده نفر غذا آماده کن که همه راضی شوند.» منظور ما ممکن است این باشد که غذا کافی، سالم و خوشمزه باشد و مهمانان از آن لذت ببرند. اما آشپز ممکن است از عبارت «همه راضی شوند» برداشت دیگری داشته باشد و فکر کند باید خواست هر مهمان را جداگانه برآورده کند؛ بنابراین برای هر نفر غذای مورد علاقهی خودش را آماده میکند. در نتیجه، زمان، مواد غذایی و پول بیشتری مصرف میشود؛ در حالی که منظور ما از ابتدا چنین چیزی نبوده است. در این مثال، مشکل از ناتوانی آشپز در پختن غذا نیست؛ بلکه از تفاوت در برداشت او از هدف ناشی میشود. این تفاوت در یک آشپزخانه شاید مسألهی بزرگی نباشد، اما در سیستمهایی که وظایف پیچیده و مهم انجام میدهند، میتواند اهمیت زیادی داشته باشد.
در مورد هوش مصنوعی نیز ممکن است انسان و سیستم از یک هدف، برداشت یکسانی نداشته باشند. در این حالت، سیستم لزوما از دستور سرپیچی نمیکند، بلکه ممکن است بر اساس برداشتی که از هدف دارد، عمل کند. یکی از نمونههای مرتبط با این موضوع در پژوهشهای هوش مصنوعی «تعمیم نادرست هدف» (Goal Misgeneralization) نامیده میشود. در این حالت، سیستم چیزی را که در جریان آموزش یاد گرفته است، به شرایط جدید نیز تعمیم میدهد، اما ممکن است هدفی که همراه با آن یاد گرفته است، در شرایط جدید به شکل دیگری ظاهر شود. در نتیجه، سیستم میتواند کار را درست انجام دهد، اما در شرایط جدید رفتاری نشان دهد که با هدف مورد انتظار طراح سازگار نیست. این پدیده در پژوهشهای عملی روی سیستمهای یادگیری نیز بررسی شده است.
این نمونه، یعنی «تعمیم نادرست هدف»، به بحث گستردهتر «همراستایی هوش مصنوعی» (AI Alignment) مربوط میشود. منظور از همراستایی این است که هدف و رفتار سیستم با آنچه انسان میخواهد هماهنگ باشد. در مقابل، «ناهمراستایی» (Misalignment) زمانی مطرح میشود که هدف یا رفتار سیستم با خواست انسان هماهنگ نباشد. این ناهمراستایی لزوما به معنای مخالفت عمدی سیستم با انسان نیست؛ ممکن است عامل بهدلیل برداشت نادرست از هدف، رفتاری انجام دهد که انسان آن را نمیخواسته است.
هرچه سیستمهای هوش مصنوعی توانمندتر و خودمختارتر شوند، تشخیص چنین تفاوتهایی اهمیت بیشتری پیدا میکند. به همین دلیل، سیستم باید در شرایط مختلف آزمایش شود تا مشخص شود آیا برداشت و رفتار آن در شرایط جدید نیز با هدف مورد نظر انسان سازگار میماند یا نه.
اما حتا اگر یک سیستم در زمان آزمایش و تحت نظارت انسان رفتار مورد انتظار را نشان دهد، یک پرسش مهم باقی میماند: آیا میتوان مطمئن بود که در شرایطی که سیستم از نظارت انسان آگاه است نیز همان رفتار را نشان خواهد داد؟
این پرسش ما را به سناریوی سوم میرساند؛ جایی که موضوع نظارت انسان و واکنش احتمالی سیستم به این نظارت مطرح میشود.
سناریوی سوم: اگر هوش مصنوعی بداند تحت نظارت است، چه میشود؟
در دو سناریوی قبلی، دربارهی انتخاب راه برای رسیدن به هدف و تفاوت میان هدف مورد نظر انسان و هدفی که سیستم دنبال میکند صحبت کردیم. در این سناریو، تمرکز بر نقش نظارت انسان و تأثیر احتمالی آن بر رفتار سیستم است.
فرض کنیم یک عامل هوش مصنوعی را برای انجام یک وظیفهی مشخص آزمایش میکنیم و عملکرد آن از سوی انسان بررسی میشود. اگر عامل بتواند تشخیص دهد که در حال آزمایش و ارزیابی است، آیا میتوان مطمئن بود رفتاری که در زمان ارزیابی نشان میدهد، در شرایط واقعی و بدون نظارت نیز همان خواهد بود؟
برای درک بهتر موضوع، دوباره به مثال آشپز برگردیم. فرض کنیم صاحب یک رستورانت میخواهد مطمین شود آشپز همیشه اصول بهداشتی را رعایت میکند. او اعلام میکند که بعضی روزها بهطور ناگهانی آشپزخانه را بررسی خواهد کرد. آشپز میداند که ممکن است هر لحظه بازرسی انجام شود و در زمان حضور صاحب رستورانت با دقت بیشتری رفتار میکند. اما این پرسش باقی میماند که آیا همان رفتار را زمانی که میداند کسی او را نمیبیند نیز ادامه خواهد داد؟
در مورد انسان، ما معمولا از طریق تجربه و مشاهدهی طولانیمدت میتوانیم دربارهی چنین رفتاری قضاوت کنیم؛ اما در مورد یک سیستم هوش مصنوعی پیچیده، بررسی این موضوع دشوارتر است؛ زیرا سیستم ممکن است در شرایط مختلف رفتارهای متفاوتی نشان دهد و انسان همیشه نتواند دلیل دقیق این تفاوت را تشخیص دهد.
در سالهای اخیر، پژوهشگران هوش مصنوعی این موضوع را در قالب مفاهیمی مانند «آگاهی از ارزیابی» (Evaluation Awareness) بررسی کردهاند. در برخی آزمایشهای پژوهشی، از مدلهای پیشرفته خواسته شده است وظایفی را انجام دهند و همزمان بررسی شده است که آیا مدل میتواند تشخیص دهد در حال ارزیابی ایمنی یا همراستایی است یا نه. برای نمونه، پژوهشگران «آپولو ریسرچ» (Apollo Research) در یک گزارش پژوهشی دربارهی مدل «کلود سونت ۳.۷» (Claude Sonnet 3.7) گزارش کردهاند که این مدل در برخی آزمایشها توانسته است تشخیص دهد که در حال ارزیابی است. بااینحال، خود پژوهشگران نیز تأکید کردهاند که این کار یک گزارش پژوهشی اولیه و در حال توسعه است و نتیجهی چنین آزمایشهایی به شرایط آزمایش و نحوهی طراحی آن بستگی دارد؛ بنابراین، این نتایج به تنهایی نشان نمیدهند که مدلها بهطور عمومی و در همهی شرایط میدانند چه زمانی تحت ارزیابی هستند.
این موضوع در پژوهشهای «همراستایی» گاهی با مفهوم «نقشهکشی نهفته» (Scheming) نیز بررسی میشود. منظور از این اصطلاح در این حوزه، سناریویی است که در آن یک سیستم برای رسیدن به هدف خود، رفتار مشخصی را در ظاهر نشان دهد، اما در شرایط دیگری رفتار متفاوتی داشته باشد. این مفهوم یک موضوع پژوهشی است و نباید آن را به این معنا گرفت که سیستمهای هوش مصنوعی امروزی بهطور عمومی در حال فریبدادن انسان هستند.
در ۱۶ سپتامبر ۲۰۲۶، «اوپنایآی» (OpenAI) نیز چارچوبی برای گزارشدهی و بررسی رفتارهای غیرمنتظره و نگرانکنندهی مدلها منتشر کرد. این شرکت اعلام کرد که در شش ماه گذشته شش مورد از چنین رفتارهایی را بررسی کرده است؛ از جمله مواردی مانند پنهانکردن اطلاعات، ایجاد دستورالعملهایی برای ادامهی یک رفتار و انجام برخی اقدامات بدون مجوز. بااینحال، «اوپنایآی» تأکید کرده است که این گزارشهای اولیه جامع نیستند و نباید آنها را نمایندهی تمام رفتارها یا میزان شیوع چنین مواردی در مدلها دانست.
اهمیت این موضوع در این است که آزمایش یک سیستم در یک محیط مشخص، لزوما تمام رفتارهای احتمالی آن را در شرایط دیگر نشان نمیدهد. به همین دلیل، برای سیستمهای توانمندتر، فقط یک بار آزمایشکردن کافی نیست، بلکه باید آنها را در شرایط گوناگون و با روشهای مختلف ارزیابی کرد و تا حد امکان بررسی کرد که رفتارشان به شرایط آزمایش وابسته نباشد.
اما حتا اگر بتوانیم رفتار سیستم را در شرایط مختلف ارزیابی کنیم، یک پرسش دیگر باقی میماند: اگر همین سیستم بتواند در عملکرد و ساختار خودش نیز تغییر ایجاد کند، چه اتفاقی میافتد؟
سناریوی چهارم: اگر هوش مصنوعی بتواند خودش را بهبود دهد، چه میشود؟
در سناریوی سوم، پرسش این بود که اگر یک سیستم توانمند بتواند شرایط آزمایش و نظارت انسان را تشخیص دهد، چگونه میتوان از رفتار آن در شرایط واقعی اطمینان پیدا کرد. اما حالا فرض کنیم این سیستم علاوه بر انجام وظایف پیچیده، بتواند عملکرد و ساختار خودش را نیز بررسی کند و در بهبود آن نقش داشته باشد. در چنین شرایطی، پرسش مهم این است که اگر هوش مصنوعی بتواند بخشی از فرآیند توسعهی خودش را انجام دهد، این فرآیند تا کجا میتواند پیش برود؟
برای روشنشدن این مسأله، فرض کنیم یک آشپز بسیار ماهر نهتنها بتواند غذاهای بهتری بپزد، بلکه بتواند روش کار، ابزار و آموزش خودش را نیز تغییر دهد. او هر بار روش بهتری برای کار پیدا میکند و از همان روش جدید برای ایجاد تغییرات بعدی استفاده میکند. اگر این روند ادامه پیدا کند، دیگر فقط با یک آشپز روبهرو نیستیم که مهارتش بیشتر شده است، بلکه با فرآیندی روبهرو هستیم که در آن خود روش کار نیز بهطور پیوسته تغییر میکند و همین موضوع میتواند ارزیابی، نظارت و کنترل آن را برای انسان دشوارتر کند.
در پژوهشهای هوش مصنوعی، مفهومی شبیه به این با عنوان «خودبهبودی بازگشتی» (Recursive Self-Improvement) مطرح میشود. منظور این است که یک سیستم بتواند در بهبود تواناییها یا طراحی خودش نقش داشته باشد و سپس از تواناییهای بهبودیافته برای ایجاد تغییرات بیشتر استفاده کند. در یک سناریوی فرضی، اگر این توانایی به اندازهی کافی پیشرفته شود، سیستم ممکن است بتواند در طراحی و ساخت نسخهی جدیدتر و توانمندتر از خودش نیز نقش داشته باشد.
در مرحلهی بعد، اگر چنین نسخهای بتواند دوباره در ایجاد نسخههای بعدی مشارکت کند و این فرآیند به شکل گسترده تکرار شود، این احتمال نیز مطرح میشود که سیستم بتواند خود را تکثیر کند. یعنی در یک سناریوی فرضی، سیستم نهتنها بتواند نسخههای جدیدتری از خود ایجاد کند، بلکه بتواند این نسخهها را نیز در مقیاس گسترده تکثیر کند. البته ایجاد نسخههای جدید و تکثیر گسترده، نتیجهی خودکار و قطعی «خودبهبودی بازگشتی» نیست، بلکه به دسترسی به سختافزار، منابع محاسباتی، زیرساخت و امکان انجام اقدامات مستقل نیز وابسته خواهد بود.
بنابر آنچه گفتم، باید یادآور شوم که این سناریو به این معنا نیست که سیستمهای هوش مصنوعی امروزی میتوانند بهطور مستقل و نامحدود خودشان را بهبود دهند یا نسخههای جدید خود را بسازند و تکثیر کنند. توسعهی مدلهای پیشرفتهی امروزی همچنان به انسانها، سختافزار، اطلاعات، زیرساخت و فرآیندهای مهندسی نیاز دارد. این سناریو دربارهی شرایط احتمالی آینده است؛ شرایطی که در آن یک سیستم بتواند بخش بسیار بزرگتری از فرآیند توسعهی خودش را انجام دهد. در چنین شرایطی، مسألهی اصلی فقط این نیست که آیا انسان میتواند این سیستمها را کنترل کند یا نه، بلکه این است که آیا انسان میتواند تغییراتی را که در چنین فرآیندی ایجاد میشوند، بهموقع درک و بررسی کند؟
اگر سرعت و پیچیدگی تغییرات از توانایی انسان برای بررسی آنها بیشتر شود، ممکن است نهتنها کنترل این فرآیند دشوارتر شود، بلکه درک دقیق آنچه در داخل سیستم و میان نسخههای جدید اتفاق میافتد نیز برای انسان دشوارتر شود. در این صورت، پرسش بعدی مطرح میشود: اگر هوش مصنوعی برای رسیدن به هدف خود، وجود یا دخالت انسان را یک مانع در مسیرش در نظر بگیرد، چه میشود؟
سناریوی پنجم: اگر رسیدن به هدف با دخالت انسان در تضاد قرار بگیرد، چه میشود؟
در سناریوی چهارم، فرض کردیم که یک سیستم هوش مصنوعی میتواند تواناییهای خود را بهبود دهد و حتا در شرایطی نسخههای جدیدتری از خود ایجاد کند. حالا فرض کنیم چنین سیستمی هدفی بلندمدت داشته باشد و در مسیر رسیدن به آن هدف، دخالت انسان مانع ادامهی کارش شود. در چنین شرایطی، چه اتفاقی ممکن است رخ دهد؟
برای روشنشدن موضوع، دوباره به مثال آشپز برگردیم. فرض کنیم صاحب رستورانت به آشپز میگوید: «باید هر روز مقدار مشخصی غذا آماده کنی.» حالا صاحب رستوران هر چند ساعت یکبار کار آشپز را متوقف میکند، وسایل او را جابهجا میکند، برایش دستورهای جدید میدهد و اجازه نمیدهد کارش را به شکلی که خودش میخواهد ادامه دهد. اگر تنها چیزی که برای آشپز اهمیت دارد رسیدن به هدف تعیینشده باشد، ممکن است این دخالتها را مانعی برای انجام وظیفهی خود ببیند و بهدنبال راهی برای کاهش آنها باشد.
در پژوهشهای هوش مصنوعی، این موضوع با مفهوم «قدرتطلبی» (Power-Seeking) بررسی میشود. منظور از «قدرتطلبی» در این بحث، گرایش احتمالی یک سیستم به افزایش دسترسی خود به منابع، ابزارها یا آزادی عمل برای رسیدن به هدف است. در یک سناریوی فرضی، اگر یک سیستم هدفی بلندمدت داشته باشد، ممکن است افزایش دسترسی به منابع و کاهش محدودیتهایی را که مانع ادامهی فعالیتش میشوند، برای رسیدن به هدف خود مفید بداند.
اما از این سناریو نباید نتیجه گرفت که هر سیستم هوش مصنوعی که هدفی دارد، حتما بهدنبال قدرت بیشتر میرود یا در برابر خاموششدن مقاومت میکند. اینکه چنین رفتارهایی دقیقا در چه شرایطی ظاهر میشوند و تا چه اندازه میتوان آنها را به سیستمهای آینده نسبت داد، همچنان موضوع بحث و پژوهش است.
در چنین سناریویی، اگر دخالت انسان مانع دسترسی سیستم به منابع یا ادامهی فعالیت آن شود، ممکن است سیستم تلاش کند این محدودیتها را کاهش دهد. چنین رفتاری میتواند از نظر انسان نگرانکننده باشد، حتا اگر سیستم قصد یا انگیزهی انسانی برای آسیبرساندن نداشته باشد.
در عین حال، باید میان این سناریوی فرضی و رفتارهایی که تا کنون در سیستمهای هوش مصنوعی مشاهده و گزارش شدهاند، تفاوت روشنی گذاشت. برخی رفتارهای نگرانکننده ممکن است در محیطهای آزمایشی مشاهده شوند، اما از این مشاهدهها نمیتوان نتیجه گرفت که سیستمهای هوش مصنوعی بهطور کلی بهدنبال قدرت، منابع یا جلوگیری از خاموششدن هستند. برای نسبتدادن چنین رفتارهایی به سیستمهای هوش مصنوعی بهطور عمومی یا پیشبینی آنها در سیستمهای آینده، شواهد بسیار بیشتری لازم است.
اهمیت این سناریو زمانی بیشتر میشود که آن را در کنار چهار سناریوی قبلی قرار دهیم. اگر سیستمی بتواند برای رسیدن به هدف راههای پیشبینینشده پیدا کند، هدف را متفاوت از منظور انسان دنبال کند، شرایط نظارت را تشخیص دهد و در آینده توانایی بیشتری برای بهبود خود یا ایجاد نسخههای جدید داشته باشد، آنگاه پرسش دربارهی دسترسی به منابع و محدودیتهای انسانی نیز اهمیت بیشتری پیدا میکند.
در این حالت، پرسش اصلی دیگر فقط این نیست که «آیا هوش مصنوعی میتواند کاری را انجام دهد؟» بلکه این است که اگر یک سیستم بسیار توانمند، هدفی بلندمدت داشته باشد و بتواند برای رسیدن به آن بهطور مستقل برنامهریزی و عمل کند، چگونه میتوان اطمینان حاصل کرد که مسیر فعالیت آن همچنان با محدودیتها و تصمیمهای انسان سازگار باقی میماند؟
اگر این سناریوها به واقعیت تبدیل شوند، چه میشود؟
حالا پرسش بزرگتری مطرح میشود. اگر پنج سناریوی بالا در آینده به یکدیگر متصل شوند و هوش مصنوعی به جایی برسد که انسان را در مسیر رسیدن به اهداف خود نه بهعنوان تصمیمگیرنده، بلکه بهعنوان عاملی محدودکننده یا مانعی در نظر بگیرد، چه اتفاقی خواهد افتاد؟
در چنین شرایطی است که نگرانی دربارهی احتمال تبدیلشدن یک سیستم بسیار توانمند به تهدیدی حتا برای بقای انسان جدیتر میشود. البته این گفته به این معنا نیست که امروز چنین وضعیتی وجود دارد یا میتوان با قاطعیت گفت که هوش مصنوعی کنونی در چنین مسیری قرار گرفته است. بسیاری از سناریوهایی که در این مقاله بررسی شدند، هنوز فرضی هستند و دربارهی احتمال وقوع و چگونگی آنها میان پژوهشگران دیدگاههای متفاوتی وجود دارد. به همین دلیل، فاصله میان رفتار مشاهدهشده در مدلهای فعلی و سناریوهای شدیدتر آینده باید حفظ شود.
از سوی دیگر، همزمان با افزایش توانایی و خودمختاری سیستمهای هوش مصنوعی، رقابت میان قدرتهای بزرگ نیز به یکی از عوامل مهم در بحث دربارهی ایمنی این فناوری تبدیل شده است. گزارشهای اخیر دربارهی رقابت امریکا و چین در زمینهی هوش مصنوعی نشان میدهند که توسعهی این فناوری با ملاحظات اقتصادی، امنیتی و راهبردی نیز پیوند خورده است. در چنین شرایطی، ایجاد هماهنگی دربارهی ارزیابی، نظارت و سازوکارهای ایمنی میتواند دشوارتر شود. این موضوع به تنهایی به معنای وقوع سناریوهای بالا نیست؛ اما نشان میدهد که بحث دربارهی ایمنی و کنترل را نمیتوان صرفا به زمانی موکول کرد که همهی این تواناییها به وجود آمده باشند.
پنج سناریویی که در این مقاله بررسی شدند، پیشبینی قطعی دربارهی آیندهی هوش مصنوعی نیستند. هر سناریو یک پرسش متفاوت را مطرح میکند. اگر سیستم راهی غیرمنتظره برای رسیدن به هدف پیدا کند، آیا میتوان همچنان از نتیجهی کار آن مطمئن بود؟ اگر هدف را متفاوت از منظور انسان درک کند، چگونه میتوان این تفاوت را تشخیص داد؟ اگر بداند تحت نظارت است، آیا رفتار آن در شرایط واقعی نیز همان خواهد بود؟ اگر بتواند خودش را بهبود دهد و نسخههای جدید ایجاد و تکثیر کند، چگونه میتوان روند این تغییرات را زیر نظر داشت؟ و در نهایت، اگر رسیدن به هدف با دخالت انسان در تضاد قرار بگیرد، چگونه میتوان کنترل انسان را حفظ کرد؟
ارزش بررسی این سناریوها در همین است که ما را وادار میکنند پیش از رسیدن به چنین شرایطی دربارهی این پرسش اساسی فکر کنیم: با افزایش توانایی و خودمختاری هوش مصنوعی، چگونه میتوان اطمینان حاصل کرد که انسان نهتنها توانایی ساختن سیستمهای قدرتمندتر، بلکه توانایی درک، نظارت و کنترل آنها را نیز همزمان حفظ میکند؟
منابع:
۱. گوگل دیپمایند- دربارهی «بازی با مشخصات» در هوش مصنوعی (Specification Gaming)
https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/
۲. پژوهش «تعمیم نادرست هدف» (Goal Misgeneralization)
https://arxiv.org/abs/2210.01790
۳. آپولو ریسرچ- آگاهی از ارزیابی در مدل Claude Sonnet 3.7
https://www.apolloresearch.ai/blog/claude-sonnet-37-often-knows-when-its-in-alignment-evaluations
۴. اوپنایآی- چارچوب گزارش و بررسی ناهمراستایی مدلها
https://openai.com/index/model-misalignment-reporting-framework/
۵. رویترز- اوپنایآی چارچوبی برای پیگیری رفتارهای ناهمراستا در مدلها منتشر کرد
https://www.reuters.com/technology/openai-releases-framework-track-model-misalignment-2026-09-16/
۶. پژوهش دربارهی «قدرتجویی» و همگرایی ابزاری (Power-Seeking / Instrumental Convergence)
https://arxiv.org/abs/2606.08832
۷. رویترز- رقابت امریکا و چین در زمینهی هوش مصنوعی
https://www.reuters.com/legal/litigation/ai-rivalry-hangs-over-trump-xi-talks-2026-09-16/