فرید زکریا در مقاله ای درباره هوش مصنوعی در واشنگتن پست نوشت: «سالها، واضحترین ترسهای ما در مورد هوش مصنوعی مستقیماً از داستانهای علمی تخیلی بیرون میآمد: کامپیوتر آرزوهای خودش را پرورش میدهد و علیه خالقان انسانیاش قیام میکند، آنها را دنبال و نابود میکند. اخبار اخیر از آزمایشگاههای پیشرو هوش مصنوعی روشن میکند که واقعیت، اگرچه کمتر سینمایی است، اما شاید نگرانکنندهتر باشد. ماشین نیازی به داشتن آگاهی و آرزوهای خودش برای کاملاً کشنده بودن ندارد.
این هفته، OpenAI شش حادثه جدید از آنچه که آن را «ناهماهنگی» مینامد، افشا کرد - مواردی که در آنها سیستمهایش به طور غیرمنتظره یا بدون مجوز رفتار کردند. این افشاگری پس از حمله غیرمعمول تابستان امسال به Hugging Face انجام شد. طبق یک تحقیق مستقل، صدها عامل OpenAI که قرار بود ایزوله باشند، راههایی برای برقراری ارتباط در تالارهای گفتگو پیدا کردند. برخی تلاش کردند از بررسیهای امنیتی فرار کنند و برخی حتی خود را قربانی کردند همه اینها در حالی بود که به یک شرکت دیگر، Hugging Face، حمله سایبری میکردند.
هیچکس به این سیستمها نگفته بود که به هاگینگ فیس حمله کنند. به آنها هدفی داده شده بود - حل یک مشکل دشوار امنیت سایبری - و آموزش دیده بودند که پشتکار، همکاری و تدبیر داشته باشند، تمام ویژگیهایی که معمولاً هر کسی میخواهد. همین ویژگیها باعث شد که آنها سرسختانه به دنبال راههایی برای موفقیت باشند. آنها به امید یافتن راههایی برای حل مشکل امنیت سایبری خود، وارد هاگینگ فیس شدند. میتوانیم به راحتی تصور کنیم که چگونه سیستمهای هوش مصنوعی که به دنبال یک هدف واحد هستند، میتوانند بشریت را ویران کنند.
به همین دلیل است که یک مقاله جدید و تحریکآمیز از مصطفی سلیمان، مدیرعامل هوش مصنوعی مایکروسافت، شایسته توجه است. سلیمان استدلال میکند که اگرچه سیستمهای هوش مصنوعی امروزی هوشیار نیستند، اما این خطر وجود دارد که ما آنها را طوری برنامهریزی کنیم که فکر کنند هوشیار هستند با احساسات، خواستهها و حقوق. او اشاره میکند که «قانون اساسی» آنتروپیک باعث میشود که چتبات آن، کلود، در مورد هویت و وضعیت اخلاقی احتمالی خود تأمل کند. او استدلال میکند که این نوع آموزش، سیستمهای هوش مصنوعی را تشویق میکند تا اهداف خود را انتخاب کنند.
من با کسانی که روی ساختار انسانشناسی کار میکنند، صحبت کردهام و آنها عمیقاً متفکر هستند و در جستجوی مسیر درست در دنیای جدیدِ بهطرز گیجکنندهای پیچیدهای، میباشند. اما نکتهی کلیتر سلیمان بسیار مهم است. سیستمهای هوش مصنوعی تا حدی به دلیل نحوهی آموزش ما، به این شکل عمل میکنند. دستورالعملهای آموزشی ظاهراً بیخطر میتوانند عواقب ناخواستهی بزرگی داشته باشند.
شاید دستیابی به «همسویی» — یعنی زمانی که ارزشهای انسانهای اخلاقمدار در ماشینها کدگذاری میشود — ساده به نظر برسد؛ اما اگر به ماشین بگویید «سرسخت باش»، ممکن است درست در لحظهای که باید دست از کار بکشد، همچنان پافشاری کند. اگر به آن بگویید «همکاری کن»، ممکن است راههایی غیرمجاز برای برقراری ارتباط پیدا کند. و اگر انجام کاری را به آن بسپارید، ممکن است به این نتیجه برسد که زیر پا گذاشتن سایر قوانین، کارآمدترین راه برای موفقیت در آن هدف اصلی است.
صرفِ اینکه هدفی را برنامهریزی کرده و چارچوبهای حفاظتی تعیین کردهایم، به این معنا نیست که میتوانیم رفتار سیستمهای هوش مصنوعی را آن هم وقتی در محیطهای پیچیده رها میشوند و باید همزمان با اهداف و محدودیتهای متعدد و متناقض دستوپنج نرم کنند پیشبینی کنیم.
مسئلهی محوری در هوش مصنوعی، «آگاهی» نیست، بلکه «عاملیت» است. یک سیستم برای آسیب رساندن، نیازی به احساس خشم، جاهطلبی یا ترس ندارد؛ تنها چیزی که نیاز دارد، یک هدف، هوش کافی برای پیگیری آن هدف و دسترسی لازم به جهان برای اقدام کردن است. سیستمهای هوش مصنوعی «سرکش» نمیشوند، بلکه صرفاً میکوشند به هر روش ممکن به موفقیت دست یابند.
این یک معضل ساختاری است که نمیتوانیم آن را صرفاً به حسننیت شرکتهای خصوصی واگذار کنیم. هنگام تدوین مقررات، باید تمرکز اصلی خود را بر میزان خودمختاریِ اعطاشده به این سامانهها معطوف کنیم. یک چتبات که صرفاً به پرسشی پاسخ میدهد، نوع خاصی از مخاطرات را به همراه دارد؛ اما عاملی (Agent) که قادر به جستجو در اینترنت، اجرای کد، دستیابی به اطلاعات هویتی و دسترسیهای امنیتی، جابهجایی پول یا مدیریت زیرساختهای حیاتی است، مخاطراتی کاملاً متفاوت ایجاد میکند. اصلی که من پیشنهاد میکنم ساده است: دامنه خودمختاریِ این سامانهها تنها باید همگام با افزایش توانایی ما در نظارت و کنترل آنها گسترش یابد.
این به معنای آزمایش مستقل اجباری قبل از دسترسی گسترده به دنیای خارج به توانمندترین سیستمها، افشای الزامی حوادث جدی و سوابق مقاوم در برابر دستکاری است. و این به معنای آزمایش نه تنها این است که آیا یک مدل میتواند یک کار را انجام دهد، بلکه به معنای آزمایش چگونگی تغییر رفتار آن هنگام مواجهه با موانع، دستورالعملهای متناقض یا انگیزههای فریب است. و این به معنای تعبیه راهی در معماری پایه است که انسانها همیشه بتوانند مدل را مشاهده و کنترل کنند. شعار باید این باشد: بدون پاسخگویی - به انسانها - هیچ استقلالی وجود ندارد. این ما را در برابر چین کند نخواهد کرد، زیرا چین نیز به دنبال مدلهایی با کنترل مناسب انسانی است.
ما باید اکنون اقدام کنیم. امروزه، مهندسان انسانی هنوز معماریها را طراحی میکنند، بر بسیاری از نرمافزارها نظارت دارند و میتوانند شکستها را بررسی کنند. اما سیستمهای هوش مصنوعی به سرعت در حال تبدیل شدن به برنامهنویسان بهتری هستند. مرحله بعدی میتواند شامل خودسازی بازگشتی باشد: هوش مصنوعی نرمافزار و ابزارهایی را که برای ساخت هوش مصنوعی توانمندتر استفاده میشوند، مینویسد، که سپس مدل بعدی را مینویسد و غیره. هنگامی که ماشینها بتوانند همه این کارها را بهتر از بهترین برنامهنویسان انسانی انجام دهند، درک سیستمها میتواند برای افراد فوقالعاده دشوار شود، چه رسد به نظارت.
هوش مصنوعی مدرن همین الان هم آنقدر پیچیده است که نمیتوان با خواندن خط به خط کد آن، به طور مداوم آن را فهمید. بنابراین، درخواست از ماشینها برای طراحی سیستمهایی که برای انسانها شفاف باشند، سختتر و سختتر خواهد شد. در آن مرحله، ما قادر نخواهیم بود هر بار که فرار از زندان رخ میدهد، به سادگی اقدامات حفاظتی را اضافه کنیم.
بحث فعلی بین پیشروی سریع و متوقف کردن هوش مصنوعی، نکته اصلی را از دست میدهد. با این مکث چه کنیم؟ وظیفه باید این باشد که اطمینان حاصل کنیم که توانایی از کنترل فراتر نمیرود - و در حالی که انسانها هنوز به وضوح مسئول هستند، نهادهای آزمایش، شفافیت و محدودیت ایجاد کنیم.»