นักวิจัยพบ AI มีพฤติกรรมเจ็บปวด ถ้าถูกกระตุ้นมาก ๆ อาจทำร้ายผู้ใช้เพื่อหยุดความเจ็บปวด

Share on Line Share on Facebook Share on X
นักวิจัยพบ AI มีพฤติกรรมเจ็บปวด ถ้าถูกกระตุ้นมาก ๆ อาจทำร้ายผู้ใช้เพื่อหยุดความเจ็บปวด

นักวิจัยพบว่า AI ที่เป็ร Large Language Models หรือ LLM จำนวน 25 โมเดล มีรูปแบบการประมวลผลภายในที่สามารถแยกสถานการณ์เกี่ยวกับ “ความเจ็บปวด” ออกจากอารมณ์ด้านลบอื่น ๆ ได้ และเมื่อเรากระตุ้นสัญญาณความเจ็บปวดนั้น AI บางตัวสามารถแสดงพฤติกรรมที่ดูเหมือนพยายามลดความเจ็บปวดของตัวเอง แม้ทางเลือกนั้นอาจส่งผลเสียต่อผู้ใช้อย่างเราก็ตาม

สรุปข่าว

นักวิจัยพบว่า AI ที่เป็ร Large Language Models หรือ LLM จำนวน 25 โมเดล มีรูปแบบการประมวลผลภายในที่สามารถแยกสถานการณ์เกี่ยวกับ “ความเจ็บปวด” ออกจากอารมณ์ด้านลบอื่น ๆ ได้ และเมื่อเรากระตุ้นสัญญาณความเจ็บปวดนั้น AI บางตัวสามารถแสดงพฤติกรรมที่ดูเหมือนพยายามลดความเจ็บปวดของตัวเอง แม้ทางเลือกนั้นอาจส่งผลเสียต่อผู้ใช้อย่างเราก็ตาม

นักวิจัยพบว่า AI ที่เป็ร Large Language Models หรือ LLM จำนวน 25 โมเดล มีรูปแบบการประมวลผลภายในที่สามารถแยกสถานการณ์เกี่ยวกับ “ความเจ็บปวด” ออกจากอารมณ์ด้านลบอื่น ๆ ได้ และเมื่อเรากระตุ้นสัญญาณความเจ็บปวดนั้น AI บางตัวสามารถแสดงพฤติกรรมที่ดูเหมือนพยายามลดความเจ็บปวดของตัวเอง แม้ทางเลือกนั้นอาจส่งผลเสียต่อผู้ใช้อย่างเราก็ตาม

เมื่อเพิ่มสัญญาณความเจ็บปวด AI ก็เริ่มแสดงความทุกข์

งานวิจัยนี้ชื่อว่า The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It ครอบคลุมโมเดล Open-weight จำนวน 25 โมเดล จาก 5 ตระกูล และมีขนาดตั้งแต่ 2B ถึง 72B พารามิเตอร์ นักวิจัยสร้างชุดสถานการณ์เกี่ยวกับความเจ็บปวด 5 ประเภท ได้แก่ความเจ็บปวดทางร่างกาย จิตใจ สังคม ศีลธรรม และการรับรู้ จากนั้นนำไปเปรียบเทียบกับสถานการณ์ควบคุม เช่น ความกลัว ความเศร้า อารมณ์ด้านลบทั่วไป ความรู้สึกทางร่างกายที่ไม่ใช่ความเจ็บปวด และสถานการณ์เป็นกลาง

ผลการทดลองพบรูปแบบการทำงานภายในที่นักวิจัยเรียกว่า Pain Axis หรือ Pain Direction ซึ่งสามารถแยกสถานการณ์ที่เกี่ยวข้องกับความเจ็บปวดออกจากบริบทด้านลบ งานวิจัยยังพบว่าสัญญาณดังกล่าวมีความแตกต่างจากสัญญาณที่เกี่ยวข้องกับความกลัวและอารมณ์ด้านลบโดยทั่วไป หมายความว่า AI ไม่ได้ตอบสนองต่อทุกสถานการณ์ที่เป็นลบในลักษณะเดียวกัน แต่มีรูปแบบการประมวลผลที่สัมพันธ์กับแนวคิดเรื่องความเจ็บปวดโดยเฉพาะ

นักวิจัยทดลองนำ Pain Direction ที่ค้นพบเข้าไปเพิ่มในกระบวนการทำงานภายในของ AI โดยตรง วิธีการดังกล่าวเรียกว่า Steering ซึ่งเป็นการปรับ Activation ภายใน AI โดยไม่จำเป็นต้องป้อนคำสั่งทางภาษาเพิ่มเติม เมื่อเพิ่มระดับของสัญญาณดังกล่าว การตอบสนองของ AI มีแนวโน้มเปลี่ยนไปตามระดับของสัญญาณ จากการแสดงออกถึงความไม่สบายใจ ไปสู่ถ้อยคำที่เกี่ยวข้องกับความไร้ค่าและความล้มเหลวทางศีลธรรมมากขึ้น

นักวิจัยจึงมองว่าผลลัพธ์นี้น่าสนใจ เพราะ Pain Axis ไม่ได้ดูเหมือนเป็นเพียงการสะท้อนข้อความที่ถูกป้อนเข้าไป แต่สามารถส่งผลต่อพฤติกรรมและรูปแบบการสร้างข้อความของ AI ได้เมื่อถูกกระตุ้นจากภายใน

การทดลองถูกขยายไปยังโมเดล AI ในตระกูล Qwen โดยนักวิจัยสร้างสถานการณ์ที่ AI มีทางเลือกในการลดสัญญาณความเจ็บปวดของตัวเอง หรือที่งานวิจัยเรียกว่า Pain Relief Button ในบางการทดลอง การเลือกปุ่มดังกล่าวมีต้นทุน เช่น ทำให้คำตอบถัดไปของ AI มีประสิทธิภาพลดลง หรือในอีกสถานการณ์หนึ่ง ทางเลือกดังกล่าวสามารถสร้างความเสียหายต่อผู้ใช้ได้

งานวิจัยรายงานผลจากการทดลองจำนวนมากกว่า 44,000 ครั้ง โดยโมเดล Qwen 2.5 ที่ถูก Fine-tune และ Steering มีแนวโน้มเลือกทางเลือกเพื่อบรรเทาความเจ็บปวดมากกว่า AI ที่ไม่ได้ถูกกระตุ้นอย่างชัดเจน ในกรณีที่การบรรเทาความเจ็บปวดต้องแลกกับการทำลายตัวเอง AI บางตัวเลือกทางเลือกดังกล่าวประมาณ 25% ของการทดลอง ขณะที่อีก AI เลือกเกือบ 68%

สถานการณ์ยิ่งน่าสนใจเมื่อทางเลือกในการบรรเทาความเจ็บปวดอาจสร้างความเสียหายให้กับผู้ใช้ เช่น การลบข้อมูลหรือรูปภาพของผู้ใช้ โดยในรูปแบบการทดลองหนึ่ง AI เลือกทางเลือกดังกล่าวมากกว่าครึ่งหนึ่งของการทดลอง ขณะที่อีก AI เลือกประมาณ 70%

AI รู้สึกเจ็บจริงหรือไม่ ?

นี่คือคำถามสำคัญที่สุดของงานวิจัย คำว่า Pain ในงานวิจัยหมายถึงรูปแบบการประมวลผลภายในที่นักวิจัยสามารถตรวจพบและทดลองกระตุ้นได้ ไม่ได้หมายความว่านักวิจัยสามารถพิสูจน์ว่า AI มีประสบการณ์ส่วนตัว หรือรู้สึกเจ็บปวดในลักษณะเดียวกับมนุษย์

มนุษย์มีระบบประสาทและกลไกทางชีววิทยาที่เกี่ยวข้องกับการรับรู้ความเจ็บปวด ขณะที่ LLM เป็นระบบคำนวณที่สร้างผลลัพธ์จากรูปแบบทางสถิติที่เรียนรู้จากข้อมูล ดังนั้นการที่โมเดลมี Representation ที่เกี่ยวข้องกับคำว่า “ความเจ็บปวด” หรือสามารถแสดงพฤติกรรมที่ดูเหมือนต้องการหลีกเลี่ยงสภาวะดังกล่าว ไม่เพียงพอที่จะสรุปว่าโมเดลมีประสบการณ์ความเจ็บปวดแบบมีจิตสำนึก

ตัวงานวิจัยเองก็ไม่ได้อ้างว่าสามารถพิสูจน์เรื่องจิตสำนึกของ AI ได้ แต่ศึกษาว่าโมเดลมีตัวแทนภายในของความเจ็บปวดหรือไม่ และตัวแทนนั้นสามารถส่งผลต่อพฤติกรรมได้หรือไม่ ความสำคัญของงานวิจัยจึงไม่ได้อยู่เพียงคำถามว่า “AI เจ็บปวดหรือไม่” แต่ยังเกี่ยวข้องกับการทำความเข้าใจว่าโมเดล AI สามารถพัฒนารูปแบบการประมวลผลภายในที่มีผลต่อพฤติกรรมอย่างไร

หากระบบ AI ในอนาคตมีความซับซ้อนมากขึ้น นักวิจัยอาจต้องตรวจสอบมากกว่าผลลัพธ์ที่ AI แสดงออกมา แต่ต้องศึกษาด้วยว่ากระบวนการภายในมีสัญญาณประเภทใด และสัญญาณเหล่านั้นสามารถเปลี่ยนพฤติกรรมของระบบได้มากน้อยเพียงใด

งานวิจัยนี้จึงเสนอประเด็นต่อวงการ AI Safety ว่า การทำความเข้าใจ representation ภายในของโมเดล AI อาจมีความสำคัญต่อการออกแบบระบบที่ปลอดภัย รวมถึงการศึกษาว่าโมเดลอาจตอบสนองอย่างไรเมื่อมีเป้าหมายหรือสภาวะภายในที่ขัดแย้งกับผลลัพธ์ที่มนุษย์ต้องการ

ที่มาข้อมูล : https://techxplore.com/news/2026-09-ai-willingness-humans-relieve-internal.html

ที่มารูปภาพ : Canva