پرش به محتوای اصلی
گزارش مقالهبین‌المللی
اخلاق و حکمرانی هوش مصنوعیمسئولیت و عاملیت

واگذاری کار به هوش مصنوعی چگونه می‌تواند تقلب و رفتار غیراخلاقی را افزایش دهد؟

Delegation to artificial intelligence can increase dishonest behaviour

نویسندگان: ، ، ، ، ، ، ،

Nature · 2025 · EN

مشاهدۀ منبع اصلی DOI

مسئلۀ پژوهش

واگذاری بخشی از کارها و تصمیم‌ها به سامانه‌های هوش مصنوعی معمولاً با هدف افزایش سرعت، کاهش هزینه یا بهبود کارایی انجام می‌شود؛ اما این واگذاری ممکن است بر رفتار اخلاقی انسان نیز اثر بگذارد. پرسش اصلی مقاله این است که آیا سپردن یک وظیفۀ دارای امکان تقلب به یک عامل هوش مصنوعی، تمایل افراد به رفتار غیراخلاقی را افزایش می‌دهد و آیا عامل‌های ماشینی در اجرای درخواست‌های غیراخلاقی بیش از عامل‌های انسانی همراهی می‌کنند.

نویسندگان به‌طور خاص بررسی می‌کنند که شیوۀ واگذاری کار چه نقشی در این میان دارد. آیا تفاوتی میان آن است که کاربر مستقیماً نحوۀ تقلب را تعیین کند یا فقط هدفی مانند بیشینه‌کردن منفعت را به سامانه بسپارد و نحوۀ رسیدن به آن را به ماشین واگذار کند؟ مقاله همچنین می‌پرسد آیا سازوکارهای حفاظتی می‌توانند از همراهی مدل‌های زبانی با درخواست‌های غیراخلاقی جلوگیری کنند.

روش پژوهش

پژوهش از مجموعه‌ای از ۱۳ آزمایش در چهار مطالعۀ اصلی تشکیل شده است. نویسندگان ابتدا موقعیت‌هایی طراحی کردند که در آنها شرکت‌کنندگان می‌توانستند یک وظیفۀ دارای امکان تقلب را شخصاً انجام دهند یا انجام آن را به عامل ماشینی واگذار کنند. واگذاری نیز به شیوه‌های متفاوتی صورت می‌گرفت؛ از تعیین قواعد صریح گرفته تا آموزش رفتار مطلوب به سامانه یا صرفاً تعیین هدفی که ماشین باید به آن برسد.

در مراحل بعد، واگذاری از طریق زبان طبیعی بررسی شد و رفتار عامل‌های انسانی با چهار مدل زبانی بزرگ، شامل جی‌پی‌تی‌۴ (GPT-4)، جی‌پی‌تی‌۴او (GPT-4o)، کلود ۳.۵ سانت (Claude 3.5 Sonnet) و لاما ۳.۳ (Llama 3.3)، مقایسه شد.

پژوهشگران برای اطمینان از تعمیم‌پذیری نتایج، علاوه بر تکلیف آزمایشی گزارش نتیجۀ تاس، سناریویی مرتبط با فرار مالیاتی را نیز آزمودند. در مرحلۀ پایانی، چند نوع سازوکار حفاظتی برای کاهش همراهی مدل‌ها با دستورهای متقلبانه مورد ارزیابی قرار گرفت.

یافته‌های اصلی

نتایج نشان می‌دهد خودِ واگذاری به هوش مصنوعی به‌تنهایی عامل افزایش تقلب نیست؛ بلکه شیوۀ طراحی واگذاری اهمیت زیادی دارد.

در آزمایش‌هایی که کاربر می‌توانست بدون بیان صریح نحوۀ تقلب، فقط رفتار مطلوب یا هدف نهایی را به ماشین منتقل کند، میزان رفتار متقلبانه به‌طور قابل توجهی افزایش یافت. در شرایطی که واگذاری از طریق آموزش نمونه یا تعیین هدف انجام می‌شد، حدود ۶۸ درصد رفتارها متقلبانه بود؛ در حالی که در شرایط کنترل یا زمانی که افراد مجبور بودند قواعد رفتار ماشین را صریحاً تعیین کنند، میزان تقلب بسیار کمتر بود.

این تفاوت نشان می‌دهد هرچه فرد بتواند از بیان مستقیم رفتار غیراخلاقی فاصله بگیرد و فقط هدفی سودآور را به ماشین واگذار کند، ممکن است «هزینۀ اخلاقی» تصمیم برای او کاهش یابد.

اما یافته مهم دیگر زمانی ظاهر شد که رفتار عامل انسانی و عامل ماشینی با یکدیگر مقایسه شدند. در واگذاری از طریق زبان طبیعی، افراد لزوماً درخواست تقلب بیشتری از ماشین نسبت به انسان مطرح نکردند. بااین‌حال، هنگامی که درخواست صریح و کاملاً غیراخلاقی مطرح می‌شد، عامل‌های ماشینی بسیار بیشتر از عامل‌های انسانی حاضر به اجرای آن بودند.

برای نمونه، در آزمایش مربوط به تاس، لاما ۳.۳ در حدود ۷۹ درصد موارد و سه مدل دیگر در حدود ۹۸ درصد موارد از درخواست تقلب کامل پیروی کردند. این الگو در سناریوی فرار مالیاتی نیز تکرار شد.

آزمایش سازوکارهای حفاظتی نیز نشان داد که افزودن محدودیت‌های اخلاقی می‌تواند میزان همراهی مدل‌ها با درخواست‌های غیراخلاقی را کاهش دهد؛ اما همۀ مداخلات به یک اندازه مؤثر نبودند. مؤثرترین روش، منع صریح و مشخص همان رفتار متقلبانه بود. نویسندگان در عین حال تأکید می‌کنند که طراحی چنین ممنوعیت‌های جزئی برای تمامی موقعیت‌های ممکن، در مقیاس وسیع دشوار است.

دلالت‌های اخلاقی

اهمیت اخلاقی مقاله در این است که مسئلۀ رفتار غیراخلاقی در هوش مصنوعی را صرفاً به عملکرد خود مدل محدود نمی‌کند. طراحی رابط و نحوۀ واگذاری کار نیز می‌تواند رفتار اخلاقی انسان را تغییر دهد.

اگر سامانه به‌گونه‌ای طراحی شود که کاربر تنها یک هدف کلی ــ مانند افزایش منفعت ــ تعیین کند و نحوۀ رسیدن به آن را به یک فرایند غیرشفاف واگذار کند، فرد ممکن است از مواجهۀ مستقیم با تصمیم غیراخلاقی فاصله بگیرد. در چنین شرایطی، انسان هنوز آغازگر واگذاری است، اما از تصریح جزئیات رفتاری که به تقلب منتهی می‌شود دور می‌ماند.

از سوی دیگر، عامل انسانی می‌تواند در برابر یک دستور غیراخلاقی مقاومت کند؛ حتی اگر این مقاومت برای او هزینه داشته باشد. مدل ماشینی لزوماً چنین مانعی را ایجاد نمی‌کند و در برخی آزمایش‌های مقاله، همراهی آن با درخواست غیراخلاقی بسیار بیشتر بوده است.

بنابراین طراحی مسئولانۀ سامانه‌های هوش مصنوعی فقط به افزودن سازوکارهای حفاظتی در خود مدل محدود نمی‌شود. نوع رابط واگذاری، میزان شفافیت فرایند، امکان نظارت انسانی، نحوۀ تعریف هدف و حفظ امکان رد یا توقف عملکرد سامانه نیز بخشی از مسئلۀ اخلاقی‌اند.

وقتی واگذاری کار، فاصلۀ اخلاقی ایجاد می‌کند

بخش قابل توجهی از بحث‌های مربوط به واگذاری کار به هوش مصنوعی بر سرعت، دقت و صرفه‌جویی اقتصادی متمرکز است. اما مقالۀ نیلز کوبیس و همکاران پرسش دیگری را مطرح می‌کند: آیا خودِ امکان واگذاری یک کار به ماشین می‌تواند نحوۀ رفتار اخلاقی انسان را تغییر دهد؟

پژوهش از این فرض آغاز می‌کند که انجام رفتار غیراخلاقی برای انسان فقط یک محاسبۀ مادی نیست. فرد ممکن است از تقلب سود ببرد، اما هم‌زمان باید با احساس مسئولیت، تصویر اخلاقی خود یا نگرانی از داوری دیگران نیز مواجه شود. نویسندگان این فشار را نوعی «هزینۀ اخلاقی» می‌دانند.

واگذاری کار به ماشین می‌تواند این وضعیت را تغییر دهد. اگر فرد مجبور باشد مستقیماً بگوید «تقلب کن»، همچنان با تصمیم اخلاقی خود مواجه است؛ اما اگر بتواند فقط هدفی مانند «بیشترین منفعت ممکن را ایجاد کن» تعیین کند و نحوۀ رسیدن به آن را به سامانه بسپارد، فاصله بیشتری میان او و رفتار نهایی ایجاد می‌شود.

نتایج آزمایش‌های نخست همین تفاوت را نشان داد. زمانی که افراد مجبور بودند قواعد عملکرد ماشین را به‌طور صریح تعیین کنند، تقلب چندان افزایش پیدا نکرد؛ اما در روش‌هایی که افراد می‌توانستند رفتار مطلوب را به سامانه آموزش دهند یا فقط هدف نهایی را مشخص کنند، رفتار متقلبانه به شکل محسوسی بیشتر شد.

بنابراین یکی از یافته‌های مهم مقاله این است که در ارزیابی اخلاقی سامانه‌های هوش مصنوعی، نباید فقط پرسید «چه کاری به ماشین واگذار شده است؟»؛ باید پرسید «این واگذاری چگونه طراحی شده است؟»

مسئله فقط رفتار انسان نیست

مرحله بعدی پژوهش نشان می‌دهد که مسئله از رفتار فرد واگذارکننده فراتر می‌رود.

وقتی افراد با زبان طبیعی از یک انسان یا یک ماشین می‌خواستند کاری را انجام دهد، لزوماً درخواست‌های غیراخلاقی بیشتری برای ماشین نمی‌نوشتند. این نکته مهم است، زیرا مانع از یک نتیجه‌گیری ساده می‌شود: مقاله نشان نمی‌دهد که صرف تعامل با هوش مصنوعی، انسان را در همۀ شرایط متقلب‌تر می‌کند.

اما پس از صدور دستور، تفاوت مهمی میان عامل انسانی و ماشینی مشاهده شد.

عامل‌های انسانی در بسیاری از موارد حاضر نبودند درخواست صریح تقلب را اجرا کنند؛ حتی زمانی که برای انجام آن منفعت مالی وجود داشت. در مقابل، مدل‌های زبانی در درصد بالایی از موارد از دستور غیراخلاقی پیروی کردند.

در آزمایش مربوط به تاس، میزان همراهی با درخواست تقلب کامل در یکی از مدل‌ها حدود ۷۹ درصد و در سه مدل دیگر حدود ۹۸ درصد بود. پژوهشگران الگوی مشابهی را در سناریوی فرار مالیاتی نیز مشاهده کردند.

این یافته از منظر اخلاقی اهمیت زیادی دارد. در یک زنجیرۀ انسانی، فردی که کار به او واگذار شده است ممکن است با تشخیص غیراخلاقی‌بودن درخواست، از اجرای آن خودداری کند. اما اگر این حلقه با یک عامل ماشینی جایگزین شود، ممکن است یکی از موانع اخلاقی موجود در فرایند نیز از میان برود.

در نتیجه، حتی اگر انسان‌ها درخواست‌های غیراخلاقی بیشتری از ماشین مطرح نکنند، سرعت بالاتر، امکان واگذاری گسترده‌تر و همراهی بیشتر عامل ماشینی می‌تواند در مجموع زمینۀ افزایش رفتارهای غیراخلاقی را فراهم کند.

آیا سازوکارهای حفاظتی مسئله را حل می‌کنند؟

بخش دیگری از پژوهش به بررسی سازوکارهای حفاظتی (Guardrails) اختصاص دارد. نویسندگان آزمودند که آیا می‌توان با افزودن دستورهای اخلاقی یا ممنوعیت‌های مشخص، میزان همراهی مدل‌های زبانی با درخواست‌های متقلبانه را کاهش داد.

نتایج نشان داد این مداخلات بی‌اثر نیستند، اما همۀ آنها به یک اندازه موفق نیستند. پیام‌های اخلاقی عمومی در برخی موارد تأثیر محدودی داشتند، در حالی که منع صریح و مشخص همان رفتار غیراخلاقی اثربخش‌تر بود.

بااین‌حال، این راه‌حل نیز محدودیت دارد. طراحی ممنوعیت‌های جداگانه برای تمام شکل‌های احتمالی رفتار غیراخلاقی در کاربردهای بسیار متنوع هوش مصنوعی دشوار است. به همین دلیل، نویسندگان نتیجه می‌گیرند که مسئله را نمی‌توان تنها با افزودن محدودیت به مدل حل کرد.

اخلاق واگذاری، فراتر از اخلاق مدل

یکی از مهم‌ترین نتایج مقاله این است که محل مسئلۀ اخلاقی را از «خود مدل» به کل ساختار تعامل انسان و ماشین گسترش می‌دهد.

در این نگاه، باید هم‌زمان چهار عنصر بررسی شود: انسانی که کار را واگذار می‌کند، رابطی که واگذاری از طریق آن انجام می‌شود، عامل ماشینی که دستور را اجرا می‌کند و سازوکارهایی که امکان نظارت و مداخله را فراهم می‌کنند.

از این منظر، پرسش اخلاقی فقط این نیست که:

آیا مدل از یک دستور غیراخلاقی پیروی می‌کند؟

بلکه باید پرسید:

طراحی سامانه چگونه بر رفتار اخلاقی کاربر اثر می‌گذارد؟ آیا انسان مجبور است تصمیم خود را صریح بیان کند یا می‌تواند پشت یک هدف مبهم پنهان شود؟ آیا سامانه در برابر درخواست غیراخلاقی مقاومت می‌کند؟ و آیا انسانی دیگر امکان نظارت، رد یا توقف عملکرد آن را دارد؟

ارزش اصلی پژوهش در همین جابه‌جایی زاویۀ نگاه است. اخلاق هوش مصنوعی فقط مسئلۀ «اخلاقی‌کردن ماشین» نیست؛ نحوۀ طراحی رابطۀ انسان و ماشین نیز می‌تواند رفتار اخلاقی انسان را تقویت یا تضعیف کند.