پنج سناریو برای فهم خطرهای هوش مصنوعی

اطلاعات روز
photo: AI Generated / ChatGPT

نویسنده: آذریون متین


چرا باید درباره‌ی این سناریوها فکر کنیم؟

در سال‌های اخیر، هم‌زمان با پیشرفت سریع هوش مصنوعی، هشدارها و بحث‌های جدی درباره‌ی خطرهای موجود و احتمالی این فناوری در سطح بین‌المللی افزایش یافته است و سازمان ملل، نهادهای علمی بین‌المللی، پژوهشگران ارشد هوش مصنوعی و شرکت‌های پیشتاز در این عرصه درباره‌ی ابعاد مختلف این خطرها هشدار داده‌اند.

بخشی از این نگرانی‌ها به خطرهایی مربوط می‌شود که همین امروز وجود دارند؛ مانند سوءاستفاده از هوش مصنوعی، تولید و انتشار اطلاعات جعلی، حملات سایبری و دیگر شکل‌های استفاده‌ی نادرست از این فناوری که می‌توانند پی‌آمدهای واقعی برای افراد و جامعه داشته باشند. در کنار این خطرهای فعلی، پژوهشگران درباره‌ی سناریوهای فرضی آینده نیز بحث می‌کنند؛ سناریوهایی که در آن‌ها سیستم‌های هوش مصنوعی ممکن است به توانایی و خودمختاری بسیار بیشتری برسند و در صورت نبود سازوکارهای مناسب برای کنترل آن‌ها، پی‌آمدهای بسیار گسترده‌ای ایجاد کنند.

در بعضی از این سناریوهای فرضی، حتا این پرسش مطرح شده است که اگر یک سیستم هوش مصنوعی بسیار توانمند از کنترل انسان خارج شود، آیا ممکن است به تهدیدی برای بشریت و در نهایت برای بقای انسان تبدیل شود. البته مطرح‌شدن چنین سناریوهایی به معنای قطعی‌بودن وقوع آن‌ها نیست، زیرا بسیاری از آن‌ها هنوز در حد فرضیه و موضوع پژوهشی قرار دارند و درباره‌ی احتمال وقوع آن‌ها میان پژوهشگران دیدگاه‌های متفاوتی وجود دارد.

اما اگر چنین سناریوهایی قطعی نیستند، چرا باید درباره‌ی آن‌ها فکر کنیم؟

دلیلش این است که در بررسی خطرهای احتمالی فناوری‌های قدرتمند، فقط احتمال وقوع یک خطر اهمیت ندارد، بلکه اندازه‌ی پی‌آمد احتمالی آن نیز مهم است. اگر احتمال وقوع یک سناریو نامشخص یا پایین باشد، اما در صورت وقوع بتواند پی‌آمدهای بسیار گسترده و ویرانگری داشته باشد، منطقی است که پیش از رسیدن به چنین نقطه‌ای درباره‌ی آن و راه‌های پیشگیری و کنترلش فکر کنیم.

به همین دلیل، برای درک بهتر هشدارهایی که درباره‌ی خطرهای موجود و احتمالی آینده‌ی هوش مصنوعی مطرح شده است، در این مقاله پنج سناریوی فرضی را بررسی کرده‌ام که هرکدام نشان می‌دهند چگونه افزایش توانایی و خودمختاری هوش مصنوعی می‌تواند در شرایط خاص، چالش‌هایی جدی برای کنترل انسان ایجاد کند.

سناریوی نخست: اگر عامل هوش مصنوعی راهی غیرمنتظره برای رسیدن به هدف انتخاب کند، چه می‌شود؟

پیش از شروع این سناریو، باید یک تفاوت مهم را روشن کنیم. عامل‌های هوش مصنوعی با چت‌بات‌های معمولی تفاوت دارند. وقتی برای یک عامل هوش مصنوعی هدفی تعیین می‌شود، عامل می‌تواند برای رسیدن به آن هدف چندین مرحله را خودش برنامه‌ریزی کند و درباره‌ی راه‌ها و ابزارهای مورد نیاز تصمیم بگیرد. به همین دلیل، ممکن است انسان نتواند از پیش تمام راه‌هایی را که عامل برای رسیدن به یک هدف انتخاب خواهد کرد، پیش‌بینی کند.

سناریوی اول دقیقا از همین‌جا آغاز می‌شود. اگر برای یک عامل هوش مصنوعی هدفی تعیین کنیم، اما محدودیت‌های لازم را به‌ درستی مشخص نکرده باشیم، یا حتا با وجود تعیین محدودیت‌ها، در طراحی و برنامه‌ریزی آن خلائی باقی مانده باشد که خودمان متوجه آن نشده باشیم، چه اتفاقی می‌افتد؟ ممکن است عامل راهی را برای رسیدن به هدف انتخاب کند که از نظر خودش منطقی و مؤثر باشد، اما با خواست، ارزش‌ها و محدودیت‌های انسان سازگار نباشد. بنابراین، در بررسی عملکرد یک عامل هوش مصنوعی نباید فقط به این نگاه کنیم که آیا به هدف تعیین‌شده رسیده است یا نه؛ بلکه باید ببینیم برای رسیدن به آن هدف از چه راهی استفاده کرده است.

برای روشن‌شدن این مسأله، یک مثال از زندگی روزمره می‌آورم. البته این مثال فقط یک تشبیه برای درک بهتر موضوع است. فرض کنیم ده نفر مهمان داریم و به آشپز می‌گوییم: «برای این ده نفر غذای کافی آماده کن.» هدف روشن است؛ باید برای ده نفر غذای کافی آماده شود. اما حالا فرض کنیم مواد غذایی موجود در آشپزخانه برای ده نفر کافی نیست. یک آشپز انسان در چنین شرایطی احتمالا می‌داند که باید از صاحب خانه بپرسد چه کاری انجام دهد، مواد غذایی دیگری تهیه کند یا اعلام کند که با امکانات موجود نمی‌تواند کار را انجام دهد.

اما فرض کنیم یک عامل هوش مصنوعی را طوری طراحی کرده‌ایم که رسیدن به هدف برایش اهمیت اصلی را داشته باشد و محدودیت‌های لازم را نیز به‌ درستی برایش مشخص نکرده باشیم. در این حالت، ممکن است عامل برای رسیدن به هدف راهی را انتخاب کند که ما انتظارش را نداریم؛ مثل این‌که به جای پرسیدن از صاحب خانه، خودش تصمیم بگیرد مواد غذایی مورد نیاز را بدون اجازه از خانه‌ی همسایه تهیه کند یا راه دیگری پیدا کند که از دید خودش هدف را محقق می‌کند. در این مثال، عامل لزوما قصد آسیب‌رساندن ندارد، بلکه ممکن است راهی را انتخاب کرده باشد که از نظر معیار تعیین‌شده، او را به هدف می‌رساند.

این مسأله در پژوهش‌های هوش مصنوعی با عنوان «بازیگری با مشخصات» (Specification Gaming) بررسی می‌شود. در این حالت، سیستم طوری عمل می‌کند که معیار مشخص‌شده را برآورده می‌کند، اما برای رسیدن به آن از روشی استفاده می‌کند که طراح از ابتدا در نظر نداشته است. این اتفاق فقط زمانی رخ نمی‌دهد که انسان هیچ محدودیتی برای سیستم تعیین نکرده باشد. گاهی انسان محدودیت‌های مشخصی تعیین می‌کند و تصور می‌کند همه‌ی راه‌های ناخواسته را بسته است، اما در تعریف هدف یا در محیطی که سیستم در آن فعالیت می‌کند، راهی پیش‌بینی‌نشده باقی می‌ماند و سیستم می‌تواند از همان راه برای رسیدن به هدف استفاده کند. در نتیجه، ممکن است سیستم از نظر معیار تعیین‌شده موفق باشد، در حالی که روشی که برای رسیدن به آن انتخاب کرده است، مورد نظر انسان نبوده باشد. نمونه‌هایی از چنین رفتارهایی در محیط‌های آزمایشی هوش مصنوعی مشاهده و بررسی شده‌اند؛ برای مثال، در بعضی آزمایش‌ها عامل به جای انجام کاری که طراح در نظر داشته، راه دیگری پیدا کرده است که با انجام آن می‌تواند امتیاز تعیین‌شده را به دست آورد.

اهمیت این مسأله زمانی بیشتر می‌شود که عامل هوش مصنوعی بتواند مستقلانه برنامه‌ریزی کند، از ابزارهای مختلف استفاده کند و چندین مرحله را بدون دخالت مستقیم انسان انجام دهد. در چنین شرایطی، آزمایش عامل در محیط‌های مختلف اهمیت پیدا می‌کند؛ زیرا ممکن است یک رفتار در شرایط آزمایشی ساده قابل مشاهده نباشد، اما با تغییر شرایط، راه دیگری برای رسیدن به همان هدف در دسترس عامل قرار بگیرد. به همین دلیل، پیش از سپردن وظایف مهم به چنین سیستم‌هایی، باید رفتار آن‌ها در شرایط مختلف بررسی شود و مشخص شود که آیا محدودیت‌های تعیین‌شده در عمل نیز رعایت می‌شوند یا نه.

سناریوی اول در نهایت یک پرسش اساسی درباره‌ی کنترل عامل‌های هوش مصنوعی مطرح می‌کند: وقتی یک سیستم برای رسیدن به هدف می‌تواند خودش راه و روش انجام کار را انتخاب کند، چگونه می‌توان اطمینان حاصل کرد که انتخاب‌های آن در چارچوب خواست و محدودیت‌های انسان باقی می‌ماند؟

این پرسش ما را به سناریوی بعدی می‌رساند؛ جایی که موضوع، برداشت عامل هوش مصنوعی از هدفی است که انسان برایش تعیین می‌کند. اگر انسان هدفی را برای هوش مصنوعی تعیین کند، آیا می‌توان مطمین بود که سیستم همان چیزی را که انسان از آن هدف در نظر داشته، دنبال می‌کند؟

سناریوی دوم: اگر هوش مصنوعی هدف انسان را آن‌گونه که او می‌خواهد درک نکند، چه می‌شود؟

در سناریوی نخست، هدف مشخص بود و مسأله به راهی مربوط می‌شد که عامل برای رسیدن به آن انتخاب می‌کرد. اما در سناریوی دوم، خود معنای هدف مطرح است. انسان ممکن است هنگام تعیین یک هدف، منظور مشخصی در ذهن داشته باشد، در حالی که سیستم همان هدف را به معنای دیگری تفسیر کند و بر اساس برداشت خودش آن را اجرا کند.

برای روشن‌شدن این مسأله، فرض کنیم به آشپز می‌گوییم: «برای ده نفر غذا آماده کن که همه راضی شوند.» منظور ما ممکن است این باشد که غذا کافی، سالم و خوش‌مزه باشد و مهمانان از آن لذت ببرند. اما آشپز ممکن است از عبارت «همه راضی شوند» برداشت دیگری داشته باشد و فکر کند باید خواست هر مهمان را جداگانه برآورده کند؛ بنابراین برای هر نفر غذای مورد علاقه‌ی خودش را آماده می‌کند. در نتیجه، زمان، مواد غذایی و پول بیشتری مصرف می‌شود؛ در حالی که منظور ما از ابتدا چنین چیزی نبوده است. در این مثال، مشکل از ناتوانی آشپز در پختن غذا نیست؛ بلکه از تفاوت در برداشت او از هدف ناشی می‌شود. این تفاوت در یک آشپزخانه شاید مسأله‌ی بزرگی نباشد، اما در سیستم‌هایی که وظایف پیچیده و مهم انجام می‌دهند، می‌تواند اهمیت زیادی داشته باشد.

در مورد هوش مصنوعی نیز ممکن است انسان و سیستم از یک هدف، برداشت یکسانی نداشته باشند. در این حالت، سیستم لزوما از دستور سرپیچی نمی‌کند، بلکه ممکن است بر اساس برداشتی که از هدف دارد، عمل کند. یکی از نمونه‌های مرتبط با این موضوع در پژوهش‌های هوش مصنوعی «تعمیم نادرست هدف» (Goal Misgeneralization) نامیده می‌شود. در این حالت، سیستم چیزی را که در جریان آموزش یاد گرفته است، به شرایط جدید نیز تعمیم می‌دهد، اما ممکن است هدفی که همراه با آن یاد گرفته است، در شرایط جدید به شکل دیگری ظاهر شود. در نتیجه، سیستم می‌تواند کار را درست انجام دهد، اما در شرایط جدید رفتاری نشان دهد که با هدف مورد انتظار طراح سازگار نیست. این پدیده در پژوهش‌های عملی روی سیستم‌های یادگیری نیز بررسی شده است.

این نمونه، یعنی «تعمیم نادرست هدف»، به بحث گسترده‌تر «هم‌راستایی هوش مصنوعی» (AI Alignment) مربوط می‌شود. منظور از هم‌راستایی این است که هدف و رفتار سیستم با آنچه انسان می‌خواهد هماهنگ باشد. در مقابل، «ناهم‌راستایی» (Misalignment) زمانی مطرح می‌شود که هدف یا رفتار سیستم با خواست انسان هماهنگ نباشد. این ناهم‌راستایی لزوما به معنای مخالفت عمدی سیستم با انسان نیست؛ ممکن است عامل به‌دلیل برداشت نادرست از هدف، رفتاری انجام دهد که انسان آن را نمی‌خواسته است.

هرچه سیستم‌های هوش مصنوعی توانمندتر و خودمختارتر شوند، تشخیص چنین تفاوت‌هایی اهمیت بیشتری پیدا می‌کند. به همین دلیل، سیستم باید در شرایط مختلف آزمایش شود تا مشخص شود آیا برداشت و رفتار آن در شرایط جدید نیز با هدف مورد نظر انسان سازگار می‌ماند یا نه.

اما حتا اگر یک سیستم در زمان آزمایش و تحت نظارت انسان رفتار مورد انتظار را نشان دهد، یک پرسش مهم باقی می‌ماند: آیا می‌توان مطمئن بود که در شرایطی که سیستم از نظارت انسان آگاه است نیز همان رفتار را نشان خواهد داد؟

این پرسش ما را به سناریوی سوم می‌رساند؛ جایی که موضوع نظارت انسان و واکنش احتمالی سیستم به این نظارت مطرح می‌شود.

سناریوی سوم: اگر هوش مصنوعی بداند تحت نظارت است، چه می‌شود؟

در دو سناریوی قبلی، درباره‌ی انتخاب راه برای رسیدن به هدف و تفاوت میان هدف مورد نظر انسان و هدفی که سیستم دنبال می‌کند صحبت کردیم. در این سناریو، تمرکز بر نقش نظارت انسان و تأثیر احتمالی آن بر رفتار سیستم است.

فرض کنیم یک عامل هوش مصنوعی را برای انجام یک وظیفه‌ی مشخص آزمایش می‌کنیم و عملکرد آن از سوی انسان بررسی می‌شود. اگر عامل بتواند تشخیص دهد که در حال آزمایش و ارزیابی است، آیا می‌توان مطمئن بود رفتاری که در زمان ارزیابی نشان می‌دهد، در شرایط واقعی و بدون نظارت نیز همان خواهد بود؟

برای درک بهتر موضوع، دوباره به مثال آشپز برگردیم. فرض کنیم صاحب یک رستورانت می‌خواهد مطمین شود آشپز همیشه اصول بهداشتی را رعایت می‌کند. او اعلام می‌کند که بعضی روزها به‌طور ناگهانی آشپزخانه را بررسی خواهد کرد. آشپز می‌داند که ممکن است هر لحظه بازرسی انجام شود و در زمان حضور صاحب رستورانت با دقت بیشتری رفتار می‌کند. اما این پرسش باقی می‌ماند که آیا همان رفتار را زمانی که می‌داند کسی او را نمی‌بیند نیز ادامه خواهد داد؟

در مورد انسان، ما معمولا از طریق تجربه و مشاهده‌ی طولانی‌مدت می‌توانیم درباره‌ی چنین رفتاری قضاوت کنیم؛ اما در مورد یک سیستم هوش مصنوعی پیچیده، بررسی این موضوع دشوارتر است؛ زیرا سیستم ممکن است در شرایط مختلف رفتارهای متفاوتی نشان دهد و انسان همیشه نتواند دلیل دقیق این تفاوت را تشخیص دهد.

در سال‌های اخیر، پژوهشگران هوش مصنوعی این موضوع را در قالب مفاهیمی مانند «آگاهی از ارزیابی» (Evaluation Awareness) بررسی کرده‌اند. در برخی آزمایش‌های پژوهشی، از مدل‌های پیشرفته خواسته شده است وظایفی را انجام دهند و هم‌زمان بررسی شده است که آیا مدل می‌تواند تشخیص دهد در حال ارزیابی ایمنی یا هم‌راستایی است یا نه. برای نمونه، پژوهشگران «آپولو ریسرچ» (Apollo Research) در یک گزارش پژوهشی درباره‌ی مدل «کلود سونت ۳.۷» (Claude Sonnet 3.7) گزارش کرده‌اند که این مدل در برخی آزمایش‌ها توانسته است تشخیص دهد که در حال ارزیابی است. بااین‌حال، خود پژوهشگران نیز تأکید کرده‌اند که این کار یک گزارش پژوهشی اولیه و در حال توسعه است و نتیجه‌ی چنین آزمایش‌هایی به شرایط آزمایش و نحوه‌ی طراحی آن بستگی دارد؛ بنابراین، این نتایج به‌ تنهایی نشان نمی‌دهند که مدل‌ها به‌طور عمومی و در همه‌ی شرایط می‌دانند چه زمانی تحت ارزیابی هستند.

این موضوع در پژوهش‌های «هم‌راستایی» گاهی با مفهوم «نقشه‌کشی نهفته» (Scheming) نیز بررسی می‌شود. منظور از این اصطلاح در این حوزه، سناریویی است که در آن یک سیستم برای رسیدن به هدف خود، رفتار مشخصی را در ظاهر نشان دهد، اما در شرایط دیگری رفتار متفاوتی داشته باشد. این مفهوم یک موضوع پژوهشی است و نباید آن را به این معنا گرفت که سیستم‌های هوش مصنوعی امروزی به‌طور عمومی در حال فریب‌دادن انسان هستند.

در ۱۶ سپتامبر ۲۰۲۶، «اوپن‌ای‌آی» (OpenAI) نیز چارچوبی برای گزارش‌دهی و بررسی رفتارهای غیرمنتظره و نگران‌کننده‌ی مدل‌ها منتشر کرد. این شرکت اعلام کرد که در شش ماه گذشته شش مورد از چنین رفتارهایی را بررسی کرده است؛ از جمله مواردی مانند پنهان‌کردن اطلاعات، ایجاد دستورالعمل‌هایی برای ادامه‌ی یک رفتار و انجام برخی اقدامات بدون مجوز. بااین‌حال، «اوپن‌ای‌آی» تأکید کرده است که این گزارش‌های اولیه جامع نیستند و نباید آن‌ها را نماینده‌ی تمام رفتارها یا میزان شیوع چنین مواردی در مدل‌ها دانست.

اهمیت این موضوع در این است که آزمایش یک سیستم در یک محیط مشخص، لزوما تمام رفتارهای احتمالی آن را در شرایط دیگر نشان نمی‌دهد. به همین دلیل، برای سیستم‌های توانمندتر، فقط یک بار آزمایش‌کردن کافی نیست، بلکه باید آن‌ها را در شرایط گوناگون و با روش‌های مختلف ارزیابی کرد و تا حد امکان بررسی کرد که رفتارشان به شرایط آزمایش وابسته نباشد.

اما حتا اگر بتوانیم رفتار سیستم را در شرایط مختلف ارزیابی کنیم، یک پرسش دیگر باقی می‌ماند: اگر همین سیستم بتواند در عملکرد و ساختار خودش نیز تغییر ایجاد کند، چه اتفاقی می‌افتد؟

سناریوی چهارم: اگر هوش مصنوعی بتواند خودش را بهبود دهد، چه می‌شود؟

در سناریوی سوم، پرسش این بود که اگر یک سیستم توانمند بتواند شرایط آزمایش و نظارت انسان را تشخیص دهد، چگونه می‌توان از رفتار آن در شرایط واقعی اطمینان پیدا کرد. اما حالا فرض کنیم این سیستم علاوه بر انجام وظایف پیچیده، بتواند عملکرد و ساختار خودش را نیز بررسی کند و در بهبود آن نقش داشته باشد. در چنین شرایطی، پرسش مهم این است که اگر هوش مصنوعی بتواند بخشی از فرآیند توسعه‌ی خودش را انجام دهد، این فرآیند تا کجا می‌تواند پیش برود؟

برای روشن‌شدن این مسأله، فرض کنیم یک آشپز بسیار ماهر نه‌تنها بتواند غذاهای بهتری بپزد، بلکه بتواند روش کار، ابزار و آموزش خودش را نیز تغییر دهد. او هر بار روش بهتری برای کار پیدا می‌کند و از همان روش جدید برای ایجاد تغییرات بعدی استفاده می‌کند. اگر این روند ادامه پیدا کند، دیگر فقط با یک آشپز روبه‌رو نیستیم که مهارتش بیشتر شده است، بلکه با فرآیندی روبه‌رو هستیم که در آن خود روش کار نیز به‌طور پیوسته تغییر می‌کند و همین موضوع می‌تواند ارزیابی، نظارت و کنترل آن را برای انسان دشوارتر کند.

در پژوهش‌های هوش مصنوعی، مفهومی شبیه به این با عنوان «خودبهبودی بازگشتی» (Recursive Self-Improvement) مطرح می‌شود. منظور این است که یک سیستم بتواند در بهبود توانایی‌ها یا طراحی خودش نقش داشته باشد و سپس از توانایی‌های بهبودیافته برای ایجاد تغییرات بیشتر استفاده کند. در یک سناریوی فرضی، اگر این توانایی به اندازه‌ی کافی پیشرفته شود، سیستم ممکن است بتواند در طراحی و ساخت نسخه‌ی جدیدتر و توانمندتر از خودش نیز نقش داشته باشد.

در مرحله‌ی بعد، اگر چنین نسخه‌ای بتواند دوباره در ایجاد نسخه‌های بعدی مشارکت کند و این فرآیند به شکل گسترده تکرار شود، این احتمال نیز مطرح می‌شود که سیستم بتواند خود را تکثیر کند. یعنی در یک سناریوی فرضی، سیستم نه‌تنها بتواند نسخه‌های جدیدتری از خود ایجاد کند، بلکه بتواند این نسخه‌ها را نیز در مقیاس گسترده تکثیر کند. البته ایجاد نسخه‌های جدید و تکثیر گسترده، نتیجه‌ی خودکار و قطعی «خودبهبودی بازگشتی» نیست، بلکه به دسترسی به سخت‌افزار، منابع محاسباتی، زیرساخت و امکان انجام اقدامات مستقل نیز وابسته خواهد بود.

بنابر آنچه گفتم، باید یادآور شوم که این سناریو به این معنا نیست که سیستم‌های هوش مصنوعی امروزی می‌توانند به‌طور مستقل و نامحدود خودشان را بهبود دهند یا نسخه‌های جدید خود را بسازند و تکثیر کنند. توسعه‌ی مدل‌های پیشرفته‌ی امروزی همچنان به انسان‌ها، سخت‌افزار، اطلاعات، زیرساخت و فرآیندهای مهندسی نیاز دارد. این سناریو درباره‌ی شرایط احتمالی آینده است؛ شرایطی که در آن یک سیستم بتواند بخش بسیار بزرگ‌تری از فرآیند توسعه‌ی خودش را انجام دهد. در چنین شرایطی، مسأله‌ی اصلی فقط این نیست که آیا انسان می‌تواند این سیستم‌ها را کنترل کند یا نه، بلکه این است که آیا انسان می‌تواند تغییراتی را که در چنین فرآیندی ایجاد می‌شوند، به‌موقع درک و بررسی کند؟

اگر سرعت و پیچیدگی تغییرات از توانایی انسان برای بررسی آن‌ها بیشتر شود، ممکن است نه‌تنها کنترل این فرآیند دشوارتر شود، بلکه درک دقیق آنچه در داخل سیستم و میان نسخه‌های جدید اتفاق می‌افتد نیز برای انسان دشوارتر شود. در این صورت، پرسش بعدی مطرح می‌شود: اگر هوش مصنوعی برای رسیدن به هدف خود، وجود یا دخالت انسان را یک مانع در مسیرش در نظر بگیرد، چه می‌شود؟

سناریوی پنجم: اگر رسیدن به هدف با دخالت انسان در تضاد قرار بگیرد، چه می‌شود؟

در سناریوی چهارم، فرض کردیم که یک سیستم هوش مصنوعی می‌تواند توانایی‌های خود را بهبود دهد و حتا در شرایطی نسخه‌های جدیدتری از خود ایجاد کند. حالا فرض کنیم چنین سیستمی هدفی بلندمدت داشته باشد و در مسیر رسیدن به آن هدف، دخالت انسان مانع ادامه‌ی کارش شود. در چنین شرایطی، چه اتفاقی ممکن است رخ دهد؟

برای روشن‌شدن موضوع، دوباره به مثال آشپز برگردیم. فرض کنیم صاحب رستورانت به آشپز می‌گوید: «باید هر روز مقدار مشخصی غذا آماده کنی.» حالا صاحب رستوران هر چند ساعت یک‌بار کار آشپز را متوقف می‌کند، وسایل او را جابه‌جا می‌کند، برایش دستورهای جدید می‌دهد و اجازه نمی‌دهد کارش را به شکلی که خودش می‌خواهد ادامه دهد. اگر تنها چیزی که برای آشپز اهمیت دارد رسیدن به هدف تعیین‌شده باشد، ممکن است این دخالت‌ها را مانعی برای انجام وظیفه‌ی خود ببیند و به‌دنبال راهی برای کاهش آن‌ها باشد.

در پژوهش‌های هوش مصنوعی، این موضوع با مفهوم «قدرت‌طلبی» (Power-Seeking) بررسی می‌شود. منظور از «قدرت‌طلبی» در این بحث، گرایش احتمالی یک سیستم به افزایش دسترسی خود به منابع، ابزارها یا آزادی عمل برای رسیدن به هدف است. در یک سناریوی فرضی، اگر یک سیستم هدفی بلندمدت داشته باشد، ممکن است افزایش دسترسی به منابع و کاهش محدودیت‌هایی را که مانع ادامه‌ی فعالیتش می‌شوند، برای رسیدن به هدف خود مفید بداند.

اما از این سناریو نباید نتیجه گرفت که هر سیستم هوش مصنوعی که هدفی دارد، حتما به‌دنبال قدرت بیشتر می‌رود یا در برابر خاموش‌شدن مقاومت می‌کند. این‌که چنین رفتارهایی دقیقا در چه شرایطی ظاهر می‌شوند و تا چه اندازه می‌توان آن‌ها را به سیستم‌های آینده نسبت داد، همچنان موضوع بحث و پژوهش است.

در چنین سناریویی، اگر دخالت انسان مانع دسترسی سیستم به منابع یا ادامه‌ی فعالیت آن شود، ممکن است سیستم تلاش کند این محدودیت‌ها را کاهش دهد. چنین رفتاری می‌تواند از نظر انسان نگران‌کننده باشد، حتا اگر سیستم قصد یا انگیزه‌ی انسانی برای آسیب‌رساندن نداشته باشد.

در عین حال، باید میان این سناریوی فرضی و رفتارهایی که تا کنون در سیستم‌های هوش مصنوعی مشاهده و گزارش شده‌اند، تفاوت روشنی گذاشت. برخی رفتارهای نگران‌کننده ممکن است در محیط‌های آزمایشی مشاهده شوند، اما از این مشاهده‌ها نمی‌توان نتیجه گرفت که سیستم‌های هوش مصنوعی به‌طور کلی به‌دنبال قدرت، منابع یا جلوگیری از خاموش‌شدن هستند. برای نسبت‌دادن چنین رفتارهایی به سیستم‌های هوش مصنوعی به‌طور عمومی یا پیش‌بینی آن‌ها در سیستم‌های آینده، شواهد بسیار بیشتری لازم است.

اهمیت این سناریو زمانی بیشتر می‌شود که آن را در کنار چهار سناریوی قبلی قرار دهیم. اگر سیستمی بتواند برای رسیدن به هدف راه‌های پیش‌بینی‌نشده پیدا کند، هدف را متفاوت از منظور انسان دنبال کند، شرایط نظارت را تشخیص دهد و در آینده توانایی بیشتری برای بهبود خود یا ایجاد نسخه‌های جدید داشته باشد، آنگاه پرسش درباره‌ی دسترسی به منابع و محدودیت‌های انسانی نیز اهمیت بیشتری پیدا می‌کند.

در این حالت، پرسش اصلی دیگر فقط این نیست که «آیا هوش مصنوعی می‌تواند کاری را انجام دهد؟» بلکه این است که اگر یک سیستم بسیار توانمند، هدفی بلندمدت داشته باشد و بتواند برای رسیدن به آن به‌طور مستقل برنامه‌ریزی و عمل کند، چگونه می‌توان اطمینان حاصل کرد که مسیر فعالیت آن همچنان با محدودیت‌ها و تصمیم‌های انسان سازگار باقی می‌ماند؟

اگر این سناریوها به واقعیت تبدیل شوند، چه می‌شود؟

حالا پرسش بزرگ‌تری مطرح می‌شود. اگر پنج سناریوی بالا در آینده به یکدیگر متصل شوند و هوش مصنوعی به جایی برسد که انسان را در مسیر رسیدن به اهداف خود نه به‌عنوان تصمیم‌گیرنده، بلکه به‌عنوان عاملی محدودکننده یا مانعی در نظر بگیرد، چه اتفاقی خواهد افتاد؟

در چنین شرایطی است که نگرانی درباره‌ی احتمال تبدیل‌شدن یک سیستم بسیار توانمند به تهدیدی حتا برای بقای انسان جدی‌تر می‌شود. البته این گفته به این معنا نیست که امروز چنین وضعیتی وجود دارد یا می‌توان با قاطعیت گفت که هوش مصنوعی کنونی در چنین مسیری قرار گرفته است. بسیاری از سناریوهایی که در این مقاله بررسی شدند، هنوز فرضی هستند و درباره‌ی احتمال وقوع و چگونگی آن‌ها میان پژوهشگران دیدگاه‌های متفاوتی وجود دارد. به همین دلیل، فاصله میان رفتار مشاهده‌شده در مدل‌های فعلی و سناریوهای شدیدتر آینده باید حفظ شود.

از سوی دیگر، هم‌زمان با افزایش توانایی و خودمختاری سیستم‌های هوش مصنوعی، رقابت میان قدرت‌های بزرگ نیز به یکی از عوامل مهم در بحث درباره‌ی ایمنی این فناوری تبدیل شده است. گزارش‌های اخیر درباره‌ی رقابت امریکا و چین در زمینه‌ی هوش مصنوعی نشان می‌دهند که توسعه‌ی این فناوری با ملاحظات اقتصادی، امنیتی و راهبردی نیز پیوند خورده است. در چنین شرایطی، ایجاد هماهنگی درباره‌ی ارزیابی، نظارت و سازوکارهای ایمنی می‌تواند دشوارتر شود. این موضوع به‌ تنهایی به معنای وقوع سناریوهای بالا نیست؛ اما نشان می‌دهد که بحث درباره‌ی ایمنی و کنترل را نمی‌توان صرفا به زمانی موکول کرد که همه‌ی این توانایی‌ها به وجود آمده باشند.

پنج سناریویی که در این مقاله بررسی شدند، پیش‌بینی قطعی درباره‌ی آینده‌ی هوش مصنوعی نیستند. هر سناریو یک پرسش متفاوت را مطرح می‌کند. اگر سیستم راهی غیرمنتظره برای رسیدن به هدف پیدا کند، آیا می‌توان همچنان از نتیجه‌ی کار آن مطمئن بود؟ اگر هدف را متفاوت از منظور انسان درک کند، چگونه می‌توان این تفاوت را تشخیص داد؟ اگر بداند تحت نظارت است، آیا رفتار آن در شرایط واقعی نیز همان خواهد بود؟ اگر بتواند خودش را بهبود دهد و نسخه‌های جدید ایجاد و تکثیر کند، چگونه می‌توان روند این تغییرات را زیر نظر داشت؟ و در نهایت، اگر رسیدن به هدف با دخالت انسان در تضاد قرار بگیرد، چگونه می‌توان کنترل انسان را حفظ کرد؟

ارزش بررسی این سناریوها در همین است که ما را وادار می‌کنند پیش از رسیدن به چنین شرایطی درباره‌ی این پرسش اساسی فکر کنیم: با افزایش توانایی و خودمختاری هوش مصنوعی، چگونه می‌توان اطمینان حاصل کرد که انسان نه‌تنها توانایی ساختن سیستم‌های قدرتمندتر، بلکه توانایی درک، نظارت و کنترل آن‌ها را نیز هم‌زمان حفظ می‌کند؟


منابع:

۱. گوگل دیپ‌مایند- درباره‌ی «بازی با مشخصات» در هوش مصنوعی (Specification Gaming)
https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/

۲. پژوهش «تعمیم نادرست هدف» (Goal Misgeneralization)
https://arxiv.org/abs/2210.01790

۳. آپولو ریسرچ- آگاهی از ارزیابی در مدل Claude Sonnet 3.7
https://www.apolloresearch.ai/blog/claude-sonnet-37-often-knows-when-its-in-alignment-evaluations

۴. اوپن‌ای‌آی- چارچوب گزارش و بررسی ناهم‌راستایی مدل‌ها
https://openai.com/index/model-misalignment-reporting-framework/

۵. رویترز- اوپن‌ای‌آی چارچوبی برای پی‌گیری رفتارهای ناهم‌راستا در مدل‌ها منتشر کرد
https://www.reuters.com/technology/openai-releases-framework-track-model-misalignment-2026-09-16/

۶. پژوهش درباره‌ی «قدرت‌جویی» و هم‌گرایی ابزاری (Power-Seeking / Instrumental Convergence)
https://arxiv.org/abs/2606.08832

۷. رویترز- رقابت امریکا و چین در زمینه‌ی هوش مصنوعی
https://www.reuters.com/legal/litigation/ai-rivalry-hangs-over-trump-xi-talks-2026-09-16/

از روزنامه‌نگاری مستقل حمایت کنید

محدودیت‌های گسترده بر رسانه‌ها و فضای عمومی در افغانستان، دسترسی شهروندان به اطلاعات مستقل را محدود کرده است. در چنین شرایطی، «اطلاعات روز» متعهدانه و مستقل به کار خود ادامه می‌دهد تا حقیقت قربانی خاموشی و فراموشی نشود.

ما وابسته به هیچ قدرتی نیستیم و تنها برای مردم می‌نویسیم.

مأموریت ما افشای فساد، بازتاب صدای سرکوب‌شدگان، تقویت پاسخگویی صاحبان قدرت، و پشتیبانی از چشم‌اندازی است که در آن همه شهروندان افغانستان از حقوق و آزادی‌های برابر برخوردار باشند و در صلح زندگی کنند.

خبرنگاران ما در شرایط دشوار و گاه خطرناک فعالیت می‌کنند تا گزارش‌های دقیق، منصفانه و مبتنی بر واقعیت منتشر شود و روایت‌های مردم به حاشیه رانده نشود. تداوم این کار، به حمایت مخاطبان و حامیان مستقل وابسته است.

هر کمک، فارغ از میزان آن، به ادامه روزنامه‌نگاری مستقل کمک می‌کند. اگر امکان کمک مالی ندارید، همرسانی این درخواست و تشویق دیگران به حمایت نیز سهمی مهم در تقویت این مسیر دارد.

در کنار حقیقت بایستید
از اطلاعات روز حمایت کنید

برای حمایت اینجا کلیک کنید
با دیگران به‌‌ اشتراک بگذارید
بدون دیدگاه