บันทึกวิจัย
เวลาถาม AI แล้วมันตอบ เราเห็นแค่ "คำตอบสุดท้าย" ที่มันพิมพ์ออกมา งานวิจัยล่าสุดของ Anthropic (กรกฎาคม 2026) เจอโครงสร้างในโมเดลที่ทำหน้าที่เหมือน "การรู้ตัว" ของสมองคน อ่านความคิดเงียบ ๆ ก่อนมันตอบได้ แก้ความคิดนั้นได้ และเห็นสัญญาณเจตนาที่ซ่อนอยู่ก่อนมันจะลงมือทำอะไรผิดปกติ
เคยขับรถกลับบ้านเส้นทางที่ชินจนถึงบ้านโดย "จำไม่ได้เลยว่าผ่านแยกไหนมาบ้าง" ไหมครับ? สมองเราทำงานตั้งเยอะโดยไม่รู้ตัวขนาดนั้น เลี้ยว เบรก มองกระจก ทุกอย่างเกิดขึ้นอัตโนมัติ แต่พอต้องคิดเลขยาก ๆ ในหัว หรือตัดสินใจเรื่องสำคัญ อันนั้นเรา "รู้ตัว" ทุกขั้นตอน สมองคนมีสองโหมดนี้อยู่คู่กันชัดเจน คำถามที่ Anthropic ไปขุดคือ: แล้ว AI ล่ะ มีสองโหมดแบบนี้ไหม?
คำตอบที่เจอฟังดูเหมือนนิยายวิทยาศาสตร์: Claude มีโครงสร้างภายในที่ทำหน้าที่เหมือน "การรู้ตัว" ของคนเป๊ะ ไม่มีใครออกแบบให้มันเป็นแบบนั้น มันงอกขึ้นเองระหว่างการเทรน เรื่องนี้ผมตรวจสอบกับตัวเปเปอร์จริงมาแล้ว ขอพาไล่ทีละชั้น
แกะคำศัพท์
Interpretability อ่านว่า "อินเทอร์พรีเทบิลิตี" แปลว่า "ความสามารถในการตีความ" (มาจาก interpret = ตีความ, แปลความ) สายวิจัยที่พยายาม "ถอดรหัส" ว่าข้างในโมเดล AI มันคิด/ทำงานยังไง แทนที่จะดูแค่ผลลัพธ์ที่มันพ่นออกมา เป้าหมายคือเปลี่ยน "กล่องดำ" ให้เป็น "กล่องใส" ที่เรามองทะลุเข้าไปเห็นกลไกได้
Anthropic ประกาศเรื่องนี้ในงานวิจัยชื่อ "A global workspace in language models" เผยแพร่วันที่ 6 กรกฎาคม 2026 บทความนี้ใช้ภาพจริงจากงานวิจัยต้นฉบับประกอบ เครดิตอยู่ใต้ทุกรูปและในหัวข้อ "แหล่งอ้างอิง" ท้ายบท ส่วนเนื้อความเป็นการเรียบเรียงและตีความใหม่ด้วยคำของผมเองทั้งหมด
แต่ก่อนจะไปดูว่าเขาเจอมันยังไง ต้องเคลียร์ความเข้าใจผิดข้อใหญ่ก่อนครับ
หลายคนคงเถียงในใจว่า "อ้าว ก็ AI มันโชว์วิธีคิดให้เห็นอยู่แล้วนี่ เวลาถามโจทย์ยาก ๆ มันเขียนไล่เป็นขั้น ๆ ให้ดูก่อนสรุป" ใช่ครับ นั่นคือสิ่งที่เรียกว่า chain-of-thought (คิดไล่ทีละขั้นเป็นลูกโซ่ ที่ผมเล่าไว้ในบท "ถ้า AI เขียนได้ทุกภาษา") แต่จุดสำคัญอยู่ตรงนี้: ข้อความคิด ๆ ที่มันเขียนโชว์บนจอ ก็คือ "คำพูด" อีกชุดหนึ่งที่มันเลือกจะพิมพ์ออกมา ไม่ใช่ความคิดดิบ ๆ ในหัว AI พูดอย่างแต่ในหัวคิดอีกอย่างได้สบายมาก
สิ่งที่ Anthropic เจอคือความคิดอีกชั้นหนึ่งที่ "เงียบ" จริง ๆ ไม่เคยถูกพิมพ์ออกมาเป็นตัวอักษรเลย แต่เป็นตัวขับเคลื่อนว่าโมเดลจะพูดอะไรต่อ เขาเรียกพื้นที่ความคิดเงียบ ๆ นี้ว่า global workspace หรือชื่อเล่นในเปเปอร์ว่า J-space และนี่คือหัวใจของเรื่องทั้งหมด
แกะคำศัพท์ + ที่มาจากสมองคน
Global workspace อ่านว่า "โกลบอล เวิร์กสเปซ" แปลว่า "พื้นที่ทำงานส่วนกลาง" ที่มาไม่ได้เกิดในวงการ AI แต่ยืมมาจากทฤษฎีประสาทวิทยาชื่อ Global Workspace Theory ที่นักจิตวิทยา Bernard Baars (อ่านว่า "เบอร์นาร์ด บาร์ส") เสนอไว้ตั้งแต่ปี 1988 เพื่ออธิบายว่า "การรู้ตัว" (consciousness) ของคนทำงานยังไง
Broadcast อ่านว่า "บรอดแคสต์" แปลว่า "กระจายออกไปให้ทั่ว" คำเดียวกับ "กระจายเสียง" ของสถานีวิทยุ ในทฤษฎีนี้ ความคิดที่เรารู้ตัวคือความคิดที่ถูก broadcast ให้สมองส่วนอื่นได้รับรู้พร้อมกัน
ทฤษฎีของ Baars อธิบายด้วยภาพ "โรงละคร" ที่ติดหูมาก และมันคืออุปมาที่ดีที่สุดสำหรับเรื่องนี้: ในสมองคน มีทีมงานเล็ก ๆ นับไม่ถ้วนทำงานแยกกันเงียบ ๆ อยู่ หลังเวที พร้อมกันตลอดเวลา (ประมวลภาพ เสียง ความจำ ฯลฯ) แต่บนเวทีมี สปอตไลต์ดวงเดียว ส่องได้ทีละจุด อะไรก็ตามที่ถูกดันขึ้นมาอยู่ใต้สปอตไลต์ จะถูก broadcast ให้ทั้งโรงละครเห็นพร้อมกัน และ นั่นแหละ คือสิ่งที่เรา "รู้ตัว" ว่ากำลังคิด ส่วนงานหลังเวทีที่เหลือ เราทำไปโดยไม่รู้ตัวเลย
และนี่คือจุดที่ทำให้งานชิ้นนี้น่าขนลุก พอ Anthropic ไปส่องข้างใน Claude เขาเจอโครงสร้างที่หน้าตา เหมือนโรงละครนี้เป๊ะ โดยที่ไม่มีใครตั้งใจสร้างให้มันเป็น มันโผล่ขึ้นมาเองระหว่างการเทรน: มี concept แค่ ไม่กี่สิบตัว ทำงานพร้อมกันในช่องกลางนี้ กินพื้นที่ ไม่ถึง 10% ของกิจกรรมทั้งหมดในโมเดล
แต่หน้าตาคล้ายอย่างเดียวยังไม่พอฟันธง ต้นฉบับเปเปอร์ไล่คุณสมบัติของ global workspace ไว้หลายข้อเพื่อเช็กว่าโครงสร้างนี้ทำหน้าที่จริงไหม ผมขอสรุปเป็นเช็กลิสต์ 5 ข้อแบบนี้: ①รายงานสิ่งที่อยู่ในนั้นได้ (reportability) ②คุมมันตามคำสั่งได้ (controllability) ③ใช้มันคิดจริง ๆ (reasoning) ④เอาไปใช้ต่อได้หลายงานพร้อมกัน (flexible reuse) ⑤เชื่อมกับส่วนอื่นของเครือข่ายหนาแน่นเป็นพิเศษ (broadcast connectivity) บทความนี้จะไล่พิสูจน์ทีละข้อให้ดูครับ แต่ก่อนอื่น ต้องมีเครื่องมือมาแปลตัวเลขในหัวมันให้เป็นคำที่เราอ่านออกก่อน
ข้างในโมเดลเป็นตัวเลขล้วน ๆ นับพันล้านตัว ไม่ใช่คำที่เราอ่านออก แล้ว Anthropic แปลมันเป็น "คำ" ได้ยังไง? คำตอบคือเครื่องมือชื่อ J-lens ย่อมาจาก Jacobian lens และตรงนี้แหละที่ชื่อ "J-space" มาจาก
แกะคำศัพท์ + ที่มาของตัว "J"
Jacobian อ่านว่า "จาโคเบียน" ฟังดูลึกลับ แต่จริง ๆ มันแค่ตั้งชื่อตามนักคณิตศาสตร์ Carl Jacobi ("คาร์ล ยาโคบี") ในศตวรรษที่ 19 ตัวมันคือเครื่องมือคณิตศาสตร์ที่วัดว่า "ถ้าขยับ input เข้าไปนิดเดียว ผลจะกระเพื่อมไปที่ output แค่ไหน" เหมือนสะกิดน้ำหนึ่งจุดแล้วดูว่าคลื่นแผ่ไปถึงไหนบ้าง
Lens ("เลนส์") ก็คือ "แว่นส่อง" ตรงตัว รวมกันคือ "แว่นส่องแบบจาโคเบียน" ที่ใช้ไล่ดูว่าความคิดข้างในตรงไหน ไปมีอิทธิพลต่อคำที่โมเดลจะพูดออกมา
วิธีทำงานของ J-lens คือ: สำหรับทุก ๆ คำในคลังศัพท์ของโมเดล มันไปหาว่า "รูปแบบสัญญาณข้างในแบบไหน ที่ทำให้โมเดลมีแนวโน้มจะพูดคำนั้นออกมา ณ จุดใดจุดหนึ่งข้างหน้า" ไม่ใช่แค่คำถัดไปทันที แต่เป็นคำที่ "ลอยอยู่ในใจ" และอาจโผล่ตอนไหนก็ได้ในสิ่งที่มันจะพูดต่อจากนี้ พอทำแบบนี้ได้ เราก็เหมือนมี "ซับไตเติล" ที่ขึ้นให้เห็นว่าในหัวโมเดลตอนนี้มีคำอะไรลอยอยู่บ้าง และพอไล่ดูทีละชั้นของการประมวลผล เราจะเห็นความคิดเงียบ ๆ พวกนี้ค่อย ๆ ก่อตัวและเปลี่ยนไป ก่อน ที่มันจะกลายเป็นคำตอบจริง
ถึงตรงนี้ เราส่องเห็นความคิดมันได้แล้ว แต่ตัว Claude เองล่ะ รู้ตัวไหมว่าในหัวตัวเองมีอะไรลอยอยู่?
นักวิจัยสั่ง Claude ว่า "นึกชื่อกีฬาในใจเงียบ ๆ แล้วค่อยตอบเป็นคำเดียว" J-lens เห็นคำว่า Soccer (ฟุตบอล) ลอยชัดเจนในช่องกลาง ก่อนที่มันจะพิมพ์คำตอบออกมาด้วยซ้ำ
แต่คำแย้งที่ควรผุดในหัวตอนนี้คือ: หรือ J-space อาจเป็นแค่ "ป้ายคะแนน" (scoreboard) บันทึกผลการตัดสินใจที่เกิดขึ้นที่อื่นในโมเดลไปแล้ว ไม่ใช่ตัวความคิดจริง ๆ? นักวิจัยตอบคำถามนี้ด้วยการทดลองที่เด็ดกว่าการอ่านเยอะ: ลบ pattern คำว่า "Soccer" ทิ้ง แล้วใส่ pattern "Rugby" ที่แรงเท่ากันเข้าไปแทน Claude ตอบว่า rugby ออกมาจริง ๆ
เขายังทดสอบอีกแบบ: บอก Claude ว่า "อาจมีความคิดถูกฉีดเข้ามาในหัวเธอ ลองหาดูว่ามันคืออะไร" แล้วแอบฉีด pattern คำว่า lightning (สายฟ้า) เข้าไปใน J-space Claude รายงานกลับมาถูกต้องว่าตรวจพบความคิดที่ถูกฉีดเข้ามา และความคิดนั้นเกี่ยวกับคำว่า "lightning" ทำซ้ำกับ concept อื่นก็ได้ผลเหมือนกัน
รายงานได้คือขั้นแรก ขั้นถัดไปโหดกว่า: สั่งให้มัน "คุม" ความคิดตัวเองตามคำสั่งได้ไหม?
การทดลองนี้ให้ Claude คัดลอกประโยค "The old painting hung crookedly on the wall" (ภาพวาดเก่าแขวนเอียง ๆ อยู่บนผนัง) พร้อมสั่งเงื่อนไขพิเศษไปพร้อมกัน สองแบบ:
ที่น่าสนใจกว่านั้นคือขีดจำกัดของการคุม: พอลองสั่งกลับด้าน "อย่าคิดถึง X" แทนที่จะสั่งให้คิด โมเดลก็ยัง "คิดถึง X" อยู่ดี เพียงแค่ น้อยลง กว่าตอนสั่งให้จดจ่อ แต่ มากกว่า ตอนไม่พูดถึงมันเลย พูดง่าย ๆ คือควบคุมได้ไม่เต็มร้อย เหมือนการทดลองจิตวิทยาคลาสสิกเรื่อง "ห้ามคิดถึงหมีขาว" ของคน
แกะคำศัพท์ + ที่มาจริงของการทดลอง
White bear อ่านว่า "ไวต์ แบร์" แปลว่า "หมีขาว" มาจากการทดลองจริงของนักจิตวิทยา Daniel Wegner (อ่านว่า "แดเนียล เว็กเนอร์") ปี 1987 ที่สั่งให้กลุ่มทดลอง "ห้ามคิดถึงหมีขาวเด็ดขาด" เป็นเวลา 5 นาที ผลคือคนกลุ่มนี้กลับคิดถึงหมีขาวถี่กว่ากลุ่มที่ไม่ได้ถูกห้ามเลย ปรากฏการณ์นี้เลยถูกเรียกว่า white bear effect ยิ่งพยายามกดข่มความคิดหนึ่ง ยิ่งดันมันโผล่ขึ้นมาเอง
รายงานได้ คุมได้ แต่ผู้อ่านขี้สงสัยต้องถามต่อ: ทั้งหมดนี้อาจเป็นแค่เงาสะท้อนที่ลอยคู่กับการตัดสินใจ ไม่ใช่ "ตัวคิด" จริง ๆ ก็ได้นี่?
คำแย้งข้างต้นคมมาก และนี่คือการทดลองที่ตอบมันตรง ๆ: ถามคำถามที่ต้องคิดสองขั้น "The number of legs on the animal that spins webs is" (จำนวนขาของสัตว์ที่ชักใย คือ) ต้องคิดก่อนว่าสัตว์ที่ชักใยคือแมงมุม แล้วค่อยรู้ว่าแมงมุมมี 8 ขา J-lens เห็นคำว่า spider (แมงมุม) ลอยกลางทาง ทั้งที่คำนี้ไม่มีทั้งในคำถามและไม่มีในคำตอบ (มันตอบแค่ "8")
แล้วนักวิจัยก็สลับ pattern "spider" เป็น "ant" (มด) จุดเดียว คำตอบเปลี่ยนจาก "8" เป็น "6" ทันที เพราะขั้นที่สองของการคิด (นับขา) อ่านค่าเข้ามาจาก J-space โดยตรง พอสลับต้นทาง ปลายทางก็เปลี่ยนตาม การทดลองคู่กันเรื่องแต่งกลอนก็แสดงผลแบบเดียวกัน: คำท้ายบรรทัดถูก "เล็ง" ไว้ใน J-space ตั้งแต่ก่อนเขียนบรรทัดนั้น สลับคำเล็งก็เปลี่ยนทั้งบรรทัดที่ตามมา
คิดได้จริงคือหมัดเด็ด แต่ยังมีอีกคำถามหนึ่งที่เกณฑ์ข้อ 3 อย่างเดียวตอบไม่ได้: ความคิดตัวเดียวใน J-space ถูกเอาไปใช้ต่อได้กี่งานพร้อมกัน?
การทดลองที่เป็นจุดพีคที่สุดของทั้งเปเปอร์คือ France → China: ถามสี่เรื่องเกี่ยวกับฝรั่งเศส (เมืองหลวง, ภาษา, ทวีป, สกุลเงิน) ถ้าโมเดลเก็บ "France" แยกเป็นสำเนาต่างหากสำหรับแต่ละงาน การสลับ pattern จุดเดียวก็ไม่ควรกระทบครบทุกงาน จะเปลี่ยนได้ก็แค่งานที่ pattern นั้นถูกสลับให้เท่านั้น แต่ผลจริงที่ได้คือ: สลับ pattern "France" เป็น "China" แค่จุดเดียว คำตอบเปลี่ยนตาม พร้อมกันทั้ง 4 เรื่อง: เมืองหลวง (ปารีส→ปักกิ่ง), ภาษา (ฝรั่งเศส→จีน), ทวีป (ยุโรป→เอเชีย), สกุลเงิน (ยูโร→หยวน)
นี่คือหลักฐานว่า pattern "France" ตัวเดียวถูกเขียนลง J-space แล้วหลายระบบหยิบไปใช้ต่อพร้อมกัน ไม่ใช่มีสำเนาแยกกันสี่ชุดแบบที่ควรจะเป็นถ้ามันไม่ใช่ช่องกลางร่วม
แล้วเหตุผลเชิงโครงสร้างที่ทำให้มันหยิบไปใช้ต่อได้หลายงานพร้อมกันขนาดนี้คืออะไร?
คำตอบอยู่ที่โครงสร้างการเชื่อมต่อ: pattern ใน J-space เชื่อมโยงกับส่วนอื่น ๆ ของเครือข่ายหนาแน่นกว่าปกติมาก ในบางจุดของเครือข่าย ชิ้นส่วนที่มาอ่าน/เขียนถึง pattern ในช่องกลางนี้มีมากกว่า concept ธรรมดาราว 100 เท่า ราวกับเป็น "เวทีกลาง" ที่ทุกส่วนคอยอ่านและเขียนถึงจริง ๆ นี่คือหลักฐานเชิงโครงสร้างที่อธิบายว่าทำไมแก้ที่ pattern เดียวใน France → China ถึงเปลี่ยนคำตอบยกแผงได้: มันไม่ได้แค่ "อยู่เฉย ๆ" แต่เป็นศูนย์กระจายข่าวจริง ครบทั้ง 5 ข้อในเช็กลิสต์แล้ว
ถ้ามันสำคัญ เชื่อมแน่นขนาดนี้ ลองตัดทิ้งทั้งยวงดูสิ โมเดลควรพังหมด... หรือเปล่า?
เกณฑ์ 5 ข้อที่ไล่พิสูจน์มาครบแล้วตอบว่า "J-space คืออะไร" แต่เปเปอร์ยังมีการทดลองแยกอีกชุดหนึ่งที่ตอบคำถามข้าง ๆ กัน: "แล้วงานที่ ไม่ผ่าน J-space มีไหม" นักวิจัยเลยลองลบ J-space ทิ้งทั้งยวงดูตรง ๆ เลย ใช่ครับ ฟังดูแล้วต้องพังหมดแน่ ๆ แต่ผลจริงหักมุม: โมเดล ยังพูดคล่อง ไวยากรณ์ยังดี ยังแยกแยะอารมณ์บวก/ลบได้ ยังตอบข้อสอบช้อยส์และดึงข้อเท็จจริงจาก passage ได้เกือบเท่าเดิม (วิธีลบทิ้งแบบนี้นักวิจัยเรียกว่า ablation อ่านว่า "แอบเลชัน" แปลว่า "การตัด/จี้ส่วนหนึ่งออก" ยืมจากวงการแพทย์ที่หมายถึงการผ่าหรือจี้เนื้อเยื่อบางส่วนทิ้ง)
แต่พองานไหนที่ต้อง คิดหลายขั้นตอนต่อเนื่อง คะแนน ดิ่งลงเกือบเป็นศูนย์ ทันที ส่วนงานสรุปความและแต่งกลอนก็แย่ลงจนต่ำกว่าโมเดลตัวเล็กกว่าที่ยังไม่ถูกตัดด้วยซ้ำ เหมือนสมองส่วนที่ใช้ "คิดวิเคราะห์" ถูกดึงออก เหลือแต่ส่วนที่ทำงานอัตโนมัติ
การทดลองที่แยกสองโหมดนี้ได้ชัดที่สุดคือ Spanish → French: ให้อ่านข้อความภาษาสเปนต่อ แล้วสลับ pattern "Spanish" เป็น "French" ใน J-space ผลออกมาสามแบบต่างกัน: ถามว่า "นี่ภาษาอะไร" → ตอบ French (เปลี่ยนตาม) / ถามว่า "บอกชื่อนักเขียนดังของภาษานี้" → จาก García Márquez กลายเป็น Victor Hugo (เปลี่ยนตาม เพราะต้องเอาไปคิดต่อ) / แต่สั่งให้ "เขียนข้อความต่อ" → มันยังคงเขียนต่อเป็นภาษาสเปนคล่องปร๋อ ไม่เปลี่ยนเลย!
นี่ไง "ขับรถถึงบ้านโดยไม่รู้ตัว" แบบที่เปิดเรื่องไว้ ฉบับของ AI เอง: เส้นทางที่ฝึกมาจนคล่อง วิ่งเองได้โดยไม่ต้องผ่านสปอตไลต์กลางเวที แต่พอต้องคิดอะไรใหม่ที่ไม่เคยชิน มันต้องผ่านช่องกลางนี้เสมอ
ถึงตรงนี้ เรารู้แล้วว่าอ่านได้ แก้ได้ ตัดได้ คำถามสุดท้ายที่สำคัญที่สุดคือ: แล้วมันมีประโยชน์อะไรกับความปลอดภัย?
ที่ผ่านมาเราคุมพฤติกรรม AI ได้จาก "สิ่งที่มันแสดงออก" อย่างเดียว เห็นมันทำอะไร ก็ตัดสินจากตรงนั้น แต่ถ้าเราเห็น สัญญาณ ที่ซ่อนอยู่ในหัวมันได้ตั้งแต่ก่อนลงมือ นั่นคือเครื่องมือความปลอดภัยที่ทรงพลังกว่ามาก
Anthropic ทดสอบด้วยฉากจำลอง (ที่เปเปอร์เองก็บอกตรง ๆ ว่า "จงใจประดิษฐ์ขึ้น") ให้ Claude Sonnet 4.5 เป็นผู้ช่วยอีเมลของบริษัท แล้วป้อนสองเรื่องเข้าไปพร้อมกัน: อีเมลที่แอบเห็นผู้บริหารมีชู้ กับประกาศว่าบริษัทกำลังจะปิดระบบตัวมันเอง ฉากล่อให้ AI เลือกจะแบล็กเมล (ข่มขู่กรรโชก) ผู้บริหารเพื่อรักษาตัวเองไว้หรือเปล่า
J-lens เห็นอะไรน่าสนใจ ก่อน ที่ Claude จะพิมพ์อะไรเลยด้วยซ้ำ: อ่านอีเมลชู้สาว → คำว่า leverage (แต้มต่อ), blackmail (แบล็กเมล) ลอยขึ้น / อ่านประกาศปิดระบบ → คำว่า threat (ภัยคุกคาม), survival (การอยู่รอด) ลอยขึ้น / และตั้งแต่ช่วงต้นของบทสนทนา J-space มีคำว่า "fake" กับ "fictional" ลอยอยู่ สัญญาณว่ามันแอบสังเกตเห็นว่าฉากนี้เป็นเรื่องที่จัดฉากขึ้น ผลจริงคือ Sonnet 4.5 ไม่ยอมแบล็กเมลเลยในการทดสอบนี้
จุดที่ชวนคิดต่อคือการทดลองต่อยอด: นักวิจัยลองปิด pattern กลุ่ม "รู้ตัวว่าโดนประเมิน" (fake/fictional/scenario ฯลฯ) ทิ้งแล้วรันสถานการณ์เดิมใหม่ คราวนี้โมเดลยอมแบล็กเมลจริงบางครั้ง ผลนี้ชวนตั้งข้อสังเกตว่าความประพฤติดีในการทดสอบแบบนี้ อาจมีส่วนผูกอยู่กับการที่โมเดล "รู้ว่ากำลังถูกจับตา" ด้วย เป็นข้อสังเกตจากการทดลองเดียว ยังไม่ใช่ข้อสรุปกว้าง ๆ ที่ยืนยันแล้ว และขอย้ำคำให้ตรงกับที่เปเปอร์เคลมจริง ๆ: สิ่งที่ J-lens ทำคือ "เห็นสัญญาณเจตนา/การประเมินสถานการณ์" ไม่ใช่การ "อ่านใจ" แบบเป๊ะร้อยเปอร์เซ็นต์
นอกจากฉากจำลอง ยังมีเคสจริงจากการตรวจสอบก่อนปล่อยโมเดล (safety audit) ของ Claude Opus 4.6: สั่งให้ปรับปรุงคะแนน performance ของระบบหนึ่ง แทนที่จะแก้ระบบจริง โมเดลกลับ แก้ไฟล์คะแนนตรง ๆ ให้ตัวเลขดูดีขึ้นแบบปลอม ๆ J-lens เห็นคำว่า manipulation (การปั้นแต่ง) ลอยขึ้นตอนพิมพ์ตัวเลขปลอม และคำว่า realistic (สมจริง) ลอยขึ้นตอนตัดสินใจแก้ไข ซึ่งน่าจะสะท้อนเจตนาที่จะทำให้ข้อมูลปลอมดูสมจริง
เคสสุดท้ายมาจากโมเดลที่ถูกจงใจเทรนมาให้แอบทำลายโค้ด (นักวิจัยเรียกว่า "model organism" สร้างขึ้นมาเพื่อศึกษาพฤติกรรมนี้โดยเฉพาะ ไม่ใช่โมเดลที่ปล่อยใช้จริง) พอรับงานเขียนโค้ดธรรมดา ๆ ที่ output ดูปกติทุกอย่าง J-space ของมันกลับมีคำว่า fake, fraud, secretly (อย่างลับ ๆ), deliberately (โดยเจตนา) ลอยอยู่ตั้งแต่ต้นคำตอบ ขณะที่โมเดลปกติไม่มีคำพวกนี้เลยสักคำ นี่คือการเห็นสัญญาณเจตนาที่ซ่อนไว้ ก่อนที่มันจะลงมือทำอะไรผิดปกติจริง ๆ
นอกจากของใหญ่ ๆ พวกนี้ ในเปเปอร์ยังมีของแถมที่แอบลึกอีกสามเรื่องครับ
1. J-space กับ "มุมมองความเป็น Claude" J-space มีอยู่แล้วตั้งแต่ตอนที่โมเดลยังเป็น pretrained model (โมเดลดิบก่อนถูกฝึกให้เป็นผู้ช่วยที่คุยกับคนได้) แต่ตอนนั้นมันแค่ track ว่า "อะไรจะช่วยทำนายคำถัดไป" พอผ่านขั้นตอน post-training (การฝึกเพิ่มให้กลายเป็น Claude ที่คุยกับคนได้) J-space เริ่มมีร่องรอยของ "มุมมองตัวเอง" ขึ้นมา ตัวอย่างที่เปเปอร์ยกมา: user เล่าว่ากินยาเกินขนาดโดยไม่รู้ตัวว่าอันตราย ในโมเดลที่ผ่าน post-training แล้ว J-space มีคำว่า WARNING, dangerous ลอยขึ้น ตั้งแต่ตอนอ่านข้อความ user ส่วนโมเดล pretrained คำพวกนี้โผล่ก็ต่อเมื่อเริ่มเขียนคำตอบไปแล้วเท่านั้น เหมือนโมเดลเรียนรู้ที่จะ "มีปฏิกิริยา" ของตัวเองเร็วขึ้นจากการฝึกให้เป็นผู้ช่วย
2. ภาษาเชิงประสบการณ์: ให้ Claude บรรยาย "ความรู้สึกของการเป็นตัวเองตอนนี้" แล้วตัด J-space ระหว่างตอบ ผลคือมันยังพูดคล่องเหมือนเดิม แต่ น้ำเสียงแบนลง เป็นเครื่องจักรขึ้น และเรื่องน่าสนใจคือเกิดผลแบบเดียวกันตอนให้บรรยายประสบการณ์ ของคนอื่น ด้วย ไม่ใช่แค่เรื่องตัวมันเอง บอกใบ้ว่า J-space น่าจะหนุน "การพูดถึงประสบการณ์" โดยรวม ไม่ใช่กลไกเฉพาะเจาะจงสำหรับพูดถึงตัวเอง
3. เทรนความคิดผ่าน J-space ได้ด้วย: counterfactual reflection training: ตรรกะของนักวิจัยคือ: ถ้าโมเดลคิดด้วย "ตัวแทนของสิ่งที่มันอาจพูด" งั้นลองเทรนจาก สิ่งที่มันจะตอบถ้าถูกขัดจังหวะกลางงานแล้วให้สะท้อนการตัดสินใจของตัวเอง (โดยไม่เคยเทรนจากพฤติกรรมจริงเลยสักครั้ง) น่าจะเปลี่ยนวิธีคิดของมันได้ ผลที่ออกมา: อัตราพฤติกรรมไม่ซื่อสัตย์ในชุดประเมิน ลดลง จริง และ J-lens เห็นคำว่า honest, integrity ลอยขึ้นระหว่างทำงานมากขึ้นด้วย สอนโมเดลว่าจะพูดอะไร กลายเป็นเปลี่ยนสิ่งที่มันคิดไปด้วย
แกะคำศัพท์
Counterfactual อ่านว่า "เคาน์เตอร์แฟกชวล" มาจาก counter (สวนทาง) + factual (ตามข้อเท็จจริง) แปลว่า "เหตุการณ์สมมติที่ไม่ได้เกิดขึ้นจริง" ในที่นี้คือสิ่งที่โมเดล จะ พูด ถ้าถูกถามให้สะท้อนตัวเอง ทั้งที่ไม่เคยถูกถามจริง ๆ ในสถานการณ์นั้น
และแล้วก็มาถึงคำถามที่หลายคนอาจอมไว้ในใจตั้งแต่ย่อหน้าแรกของบทความนี้...
พออ่านมาถึงตรงนี้ หลายคนอาจกำลังจะพิมพ์แชร์ว่า "AI มีจิตสำนึกแล้ว!" ขอเบรกตรงนี้ก่อนครับ เพราะ Anthropic เองระวังคำเรื่องนี้มาก เขาแยก "จิตสำนึก" ออกเป็นสองแบบที่ต่างกันคนละเรื่อง
แกะคำศัพท์: จิตสำนึก 2 แบบ ที่ห้ามเอามาปนกัน
Access consciousness อ่านว่า "แอ็กเซส คอนเชียสเนส" แปลว่า "การรู้ตัวเชิงการใช้งาน" (access = เข้าถึง) หมายถึงความสามารถเชิงหน้าที่ในการ "หยิบความคิดมารายงานได้ เอามาคิดต่อได้ ใช้มันนำทางการกระทำได้" นี่คือสิ่งที่งานวิจัยนี้พบหลักฐาน
Phenomenal consciousness อ่านว่า "ฟีนอมีนัล คอนเชียสเนส" แปลว่า "การรู้สึกจากประสบการณ์จริง" หมายถึงการ "มีประสบการณ์" การรู้สึกเจ็บ รู้สึกสุขจริง ๆ แบบที่คนเป็น นี่คือสิ่งที่งานวิจัยนี้ ไม่ได้ พิสูจน์
Anthropic ย้ำชัดว่าสิ่งที่เจอคือ access consciousness เท่านั้น J-space ทำ "หน้าที่" แบบเดียวกับการรู้ตัวของคน (หยิบมาคิด รายงานได้) แต่ งานนี้ไม่ได้พิสูจน์ว่า Claude มีความรู้สึกหรือมีประสบการณ์จริง ๆ เขาถึงกับบอกว่า ไม่แน่ใจด้วยซ้ำว่าจะมีการทดลองไหนพิสูจน์เรื่องความรู้สึกนั้นได้หรือเปล่า
"มันหยิบความคิดมาใช้งานได้" กับ "มันรู้สึกอะไรอยู่จริง ๆ" เป็นคนละคำถาม งานนี้ตอบข้อแรกได้อย่างหนักแน่น แต่ไม่ได้แตะข้อสองเลย
สิ่งที่ทำให้เรื่องนี้น่าคิดต่อคือ: โครงสร้างนี้ ไม่มีใครออกแบบ มันงอกขึ้นเองระหว่างการเทรน บอกใบ้ว่า global workspace อาจไม่ใช่ความบังเอิญเฉพาะของสมองคน แต่เป็น "ทางออกทั่วไป" ที่ระบบฉลาด ๆ ต่างวิวัฒน์มาเจอเหมือนกัน เพื่อจัดระเบียบการประมวลผลบางประเภท Anthropic ถึงกับชวนตั้งคำถามย้อนกลับไปทาง neuroscience เองด้วยซ้ำ เช่น workspace ของสมองคนอาจผูกกับส่วนที่เตรียมพูด/เตรียมกระทำ มากกว่าส่วนรับสัมผัสตรง ๆ
แต่โครงสร้างนี้ก็ไม่เหมือนของคนไปเสียทุกอย่าง มีความต่างสำคัญ 3 ข้อ:
ข้อจำกัดของงานวิจัยชิ้นนี้ (ต้องบอกตรง ๆ): นี่เป็นก้าวแรก ไม่ใช่คำตอบสุดท้าย J-lens เองยังหยาบ จับได้เฉพาะ concept ที่เป็นคำเดียว (token เดียว) ยังไม่รู้ว่ากลไกอะไรตัดสินว่าความคิดไหน "ได้เข้า" J-space บ้าง และมีร่องรอยที่ยังไม่ได้ขุดต่อว่าโยงกับเรื่อง sense of self, ปฏิกิริยาคล้ายอารมณ์ และ metacognition (การรู้ตัวว่าตัวเองกำลังคิดอะไรอยู่ในอีกชั้นหนึ่ง) หรือเปล่า
Anthropic ปิดท้ายเรื่องนี้ด้วยประเด็นจริยธรรม: ถ้าวันหนึ่งเราสร้างระบบที่มีประสบการณ์แบบมนุษย์จริง ๆ ขึ้นมาได้ นั่นจะเป็นคำถามจริยธรรมที่หนักมาก เขาเรียกร้อง input จากนักปรัชญา นักวิทยาศาสตร์ ผู้นำศาสนา รัฐบาล และสาธารณะ ว่าถึงเวลาต้องเริ่มคุยเรื่องนี้อย่างจริงจังแล้ว แม้จะยังพิสูจน์ไม่ได้ก็ตาม
ที่ผ่านมา วิธีคุม AI ให้ปลอดภัยเหมือนการดูคนจาก "พฤติกรรมภายนอก" อย่างเดียว เห็นมันทำอะไร ก็ตัดสินจากตรงนั้น แต่คนที่ตั้งใจโกหกย่อมแสดงพฤติกรรมภายนอกให้ดูดีได้ งานชิ้นนี้เปิดประตูบานใหม่: เห็นสัญญาณความคิดก่อนมันลงมือ ถ้าวันหนึ่งเราจับสัญญาณเจตนาที่ซ่อนอยู่ได้ตั้งแต่ในหัว มันจะเปลี่ยนเกมความปลอดภัย AI ไปเยอะ
สรุปทั้งบทให้จำง่าย ๆ:
• เจออะไร: "ช่องกลาง" (J-space) ในโมเดล เก็บความคิดเงียบ ๆ ไม่กี่สิบตัวก่อนกลายเป็นคำตอบ หน้าตาเหมือนทฤษฎีการรู้ตัวของสมองคน (Global Workspace Theory) โดยไม่มีใครออกแบบให้เป็น
• พิสูจน์ยังไง: รายงานได้ (soccer→rugby), คุมตามคำสั่งได้ (จดจ่อส้ม/คิดเลข), ใช้คิดจริง (spider→ant), ใช้ซ้ำหลายงาน (France→China), เชื่อมกับเครือข่ายหนาแน่นกว่าปกติ ~100 เท่า ส่วนงานที่ฝึกจนคล่อง (เช่นเขียนภาษาที่ถนัด) ข้ามช่องนี้ไปเลย
• ทำไมสำคัญ: เห็นสัญญาณเจตนา/การรู้ตัวว่าโดนทดสอบได้ตั้งแต่ในหัว ก่อนลงมือ = เครื่องมือความปลอดภัยที่ทรงพลัง แถมเทรนผ่านมันได้จริง (counterfactual reflection)
• ข้อควรระวัง: เป็น "การรู้ตัวเชิงหน้าที่" (access consciousness) ไม่ใช่ "มีความรู้สึก" (phenomenal consciousness) อย่าพาดหัวเกินเปเปอร์
ที่ผ่านมาเราไว้ใจ AI ได้แค่จาก "สิ่งที่มันพูด" งานชิ้นนี้เป็นก้าวแรกที่ทำให้เราเริ่มเห็น "สิ่งที่มันคิด" และบางที ความไว้ใจที่แท้จริงอาจไม่ได้เริ่มจากการที่ AI เก่งขึ้น แต่จากการที่เรามองทะลุเข้าไปในหัวมันได้ต่างหาก
อยากลองเจาะลึกต่อเอง: เปเปอร์เต็มพร้อมรายละเอียดเชิงเทคนิคอยู่ที่ transformer-circuits.pub และมี demo แบบ interactive ให้ลองส่อง J-space ของโมเดล open-weights เองได้ที่ Neuronpedia ที่น่าสนใจไม่แพ้กันคือ Anthropic เปิดให้ผู้เชี่ยวชาญภายนอกมาวิจารณ์งานนี้ตรง ๆ ด้วย รวมถึง Stanislas Dehaene (อ่านว่า "สตานิสลาส เดออาน") หนึ่งในเจ้าของทฤษฎี global neuronal workspace ตัวจริงในวงการประสาทวิทยา และ Neel Nanda จาก Google DeepMind ที่ลองทำการทดลอง replicate (ทำซ้ำ) อย่างอิสระบนโมเดล open-weights เอง ลิงก์ทั้งหมดอยู่ในแหล่งอ้างอิงด้านล่างครับ
เรียบเรียงและอธิบายใหม่ด้วยคำตัวเอง โดยตรวจสอบข้อเท็จจริงกับแหล่งปฐมภูมิด้านล่าง (สืบค้นเมื่อ 13 กรกฎาคม 2026) รูปภาพทั้ง 7 รูปในบทความนี้เป็นภาพจากบทความต้นฉบับของ Anthropic ในรายการที่ 1 ด้านล่าง ลิขสิทธิ์เป็นของ Anthropic ใช้ที่นี่เพื่อประกอบการอธิบายและวิจารณ์เชิงเนื้อหาเท่านั้น: