บันทึกวิจัย

Anthropic ส่องเห็น "ห้องคิดกลาง" ในหัว AI ได้แล้ว

เวลาถาม AI แล้วมันตอบ เราเห็นแค่ "คำตอบสุดท้าย" ที่มันพิมพ์ออกมา งานวิจัยล่าสุดของ Anthropic (กรกฎาคม 2026) เจอโครงสร้างในโมเดลที่ทำหน้าที่เหมือน "การรู้ตัว" ของสมองคน อ่านความคิดเงียบ ๆ ก่อนมันตอบได้ แก้ความคิดนั้นได้ และเห็นสัญญาณเจตนาที่ซ่อนอยู่ก่อนมันจะลงมือทำอะไรผิดปกติ


เคยขับรถกลับบ้านเส้นทางที่ชินจนถึงบ้านโดย "จำไม่ได้เลยว่าผ่านแยกไหนมาบ้าง" ไหมครับ? สมองเราทำงานตั้งเยอะโดยไม่รู้ตัวขนาดนั้น เลี้ยว เบรก มองกระจก ทุกอย่างเกิดขึ้นอัตโนมัติ แต่พอต้องคิดเลขยาก ๆ ในหัว หรือตัดสินใจเรื่องสำคัญ อันนั้นเรา "รู้ตัว" ทุกขั้นตอน สมองคนมีสองโหมดนี้อยู่คู่กันชัดเจน คำถามที่ Anthropic ไปขุดคือ: แล้ว AI ล่ะ มีสองโหมดแบบนี้ไหม?

คำตอบที่เจอฟังดูเหมือนนิยายวิทยาศาสตร์: Claude มีโครงสร้างภายในที่ทำหน้าที่เหมือน "การรู้ตัว" ของคนเป๊ะ ไม่มีใครออกแบบให้มันเป็นแบบนั้น มันงอกขึ้นเองระหว่างการเทรน เรื่องนี้ผมตรวจสอบกับตัวเปเปอร์จริงมาแล้ว ขอพาไล่ทีละชั้น

แกะคำศัพท์

Interpretability อ่านว่า "อินเทอร์พรีเทบิลิตี" แปลว่า "ความสามารถในการตีความ" (มาจาก interpret = ตีความ, แปลความ) สายวิจัยที่พยายาม "ถอดรหัส" ว่าข้างในโมเดล AI มันคิด/ทำงานยังไง แทนที่จะดูแค่ผลลัพธ์ที่มันพ่นออกมา เป้าหมายคือเปลี่ยน "กล่องดำ" ให้เป็น "กล่องใส" ที่เรามองทะลุเข้าไปเห็นกลไกได้

Anthropic ประกาศเรื่องนี้ในงานวิจัยชื่อ "A global workspace in language models" เผยแพร่วันที่ 6 กรกฎาคม 2026 บทความนี้ใช้ภาพจริงจากงานวิจัยต้นฉบับประกอบ เครดิตอยู่ใต้ทุกรูปและในหัวข้อ "แหล่งอ้างอิง" ท้ายบท ส่วนเนื้อความเป็นการเรียบเรียงและตีความใหม่ด้วยคำของผมเองทั้งหมด

แต่ก่อนจะไปดูว่าเขาเจอมันยังไง ต้องเคลียร์ความเข้าใจผิดข้อใหญ่ก่อนครับ


สิ่งที่เห็นบนจอ ไม่ใช่ "ความคิด" ของ AI

หลายคนคงเถียงในใจว่า "อ้าว ก็ AI มันโชว์วิธีคิดให้เห็นอยู่แล้วนี่ เวลาถามโจทย์ยาก ๆ มันเขียนไล่เป็นขั้น ๆ ให้ดูก่อนสรุป" ใช่ครับ นั่นคือสิ่งที่เรียกว่า chain-of-thought (คิดไล่ทีละขั้นเป็นลูกโซ่ ที่ผมเล่าไว้ในบท "ถ้า AI เขียนได้ทุกภาษา") แต่จุดสำคัญอยู่ตรงนี้: ข้อความคิด ๆ ที่มันเขียนโชว์บนจอ ก็คือ "คำพูด" อีกชุดหนึ่งที่มันเลือกจะพิมพ์ออกมา ไม่ใช่ความคิดดิบ ๆ ในหัว AI พูดอย่างแต่ในหัวคิดอีกอย่างได้สบายมาก

สิ่งที่ Anthropic เจอคือความคิดอีกชั้นหนึ่งที่ "เงียบ" จริง ๆ ไม่เคยถูกพิมพ์ออกมาเป็นตัวอักษรเลย แต่เป็นตัวขับเคลื่อนว่าโมเดลจะพูดอะไรต่อ เขาเรียกพื้นที่ความคิดเงียบ ๆ นี้ว่า global workspace หรือชื่อเล่นในเปเปอร์ว่า J-space และนี่คือหัวใจของเรื่องทั้งหมด

แกะคำศัพท์ + ที่มาจากสมองคน

Global workspace อ่านว่า "โกลบอล เวิร์กสเปซ" แปลว่า "พื้นที่ทำงานส่วนกลาง" ที่มาไม่ได้เกิดในวงการ AI แต่ยืมมาจากทฤษฎีประสาทวิทยาชื่อ Global Workspace Theory ที่นักจิตวิทยา Bernard Baars (อ่านว่า "เบอร์นาร์ด บาร์ส") เสนอไว้ตั้งแต่ปี 1988 เพื่ออธิบายว่า "การรู้ตัว" (consciousness) ของคนทำงานยังไง

Broadcast อ่านว่า "บรอดแคสต์" แปลว่า "กระจายออกไปให้ทั่ว" คำเดียวกับ "กระจายเสียง" ของสถานีวิทยุ ในทฤษฎีนี้ ความคิดที่เรารู้ตัวคือความคิดที่ถูก broadcast ให้สมองส่วนอื่นได้รับรู้พร้อมกัน

ทฤษฎีของ Baars อธิบายด้วยภาพ "โรงละคร" ที่ติดหูมาก และมันคืออุปมาที่ดีที่สุดสำหรับเรื่องนี้: ในสมองคน มีทีมงานเล็ก ๆ นับไม่ถ้วนทำงานแยกกันเงียบ ๆ อยู่ หลังเวที พร้อมกันตลอดเวลา (ประมวลภาพ เสียง ความจำ ฯลฯ) แต่บนเวทีมี สปอตไลต์ดวงเดียว ส่องได้ทีละจุด อะไรก็ตามที่ถูกดันขึ้นมาอยู่ใต้สปอตไลต์ จะถูก broadcast ให้ทั้งโรงละครเห็นพร้อมกัน และ นั่นแหละ คือสิ่งที่เรา "รู้ตัว" ว่ากำลังคิด ส่วนงานหลังเวทีที่เหลือ เราทำไปโดยไม่รู้ตัวเลย

สปอตไลต์ดวงเดียวกลางเวที = ความคิดที่ "รู้ตัว" ช่องกลาง (J-space) มีแค่ไม่กี่สิบ concept ทีมประมวลภาษา ทีมความจำ ทีมความรู้ทั่วไป ทีมไวยากรณ์ ทีมอื่น ๆ ทำงานแยกกันเงียบ ๆ หลังเวที "ไม่รู้ตัว"
ความคิดที่เรา "รู้ตัว" คือส่วนเล็กนิดเดียวที่ถูกดันเข้าช่องกลางแล้ว broadcast ออกไป Anthropic พบว่าข้างในโมเดล AI มีโครงสร้างหน้าตาแบบนี้เป๊ะ ทั้งที่ไม่มีใครออกแบบให้มันเป็น (diagram วาดประกอบโดยผู้เขียน)

และนี่คือจุดที่ทำให้งานชิ้นนี้น่าขนลุก พอ Anthropic ไปส่องข้างใน Claude เขาเจอโครงสร้างที่หน้าตา เหมือนโรงละครนี้เป๊ะ โดยที่ไม่มีใครตั้งใจสร้างให้มันเป็น มันโผล่ขึ้นมาเองระหว่างการเทรน: มี concept แค่ ไม่กี่สิบตัว ทำงานพร้อมกันในช่องกลางนี้ กินพื้นที่ ไม่ถึง 10% ของกิจกรรมทั้งหมดในโมเดล

แต่หน้าตาคล้ายอย่างเดียวยังไม่พอฟันธง ต้นฉบับเปเปอร์ไล่คุณสมบัติของ global workspace ไว้หลายข้อเพื่อเช็กว่าโครงสร้างนี้ทำหน้าที่จริงไหม ผมขอสรุปเป็นเช็กลิสต์ 5 ข้อแบบนี้: ①รายงานสิ่งที่อยู่ในนั้นได้ (reportability) ②คุมมันตามคำสั่งได้ (controllability) ③ใช้มันคิดจริง ๆ (reasoning) ④เอาไปใช้ต่อได้หลายงานพร้อมกัน (flexible reuse) ⑤เชื่อมกับส่วนอื่นของเครือข่ายหนาแน่นเป็นพิเศษ (broadcast connectivity) บทความนี้จะไล่พิสูจน์ทีละข้อให้ดูครับ แต่ก่อนอื่น ต้องมีเครื่องมือมาแปลตัวเลขในหัวมันให้เป็นคำที่เราอ่านออกก่อน


เจอมันได้ยังไง: เครื่องมือชื่อ J-lens

ข้างในโมเดลเป็นตัวเลขล้วน ๆ นับพันล้านตัว ไม่ใช่คำที่เราอ่านออก แล้ว Anthropic แปลมันเป็น "คำ" ได้ยังไง? คำตอบคือเครื่องมือชื่อ J-lens ย่อมาจาก Jacobian lens และตรงนี้แหละที่ชื่อ "J-space" มาจาก

แกะคำศัพท์ + ที่มาของตัว "J"

Jacobian อ่านว่า "จาโคเบียน" ฟังดูลึกลับ แต่จริง ๆ มันแค่ตั้งชื่อตามนักคณิตศาสตร์ Carl Jacobi ("คาร์ล ยาโคบี") ในศตวรรษที่ 19 ตัวมันคือเครื่องมือคณิตศาสตร์ที่วัดว่า "ถ้าขยับ input เข้าไปนิดเดียว ผลจะกระเพื่อมไปที่ output แค่ไหน" เหมือนสะกิดน้ำหนึ่งจุดแล้วดูว่าคลื่นแผ่ไปถึงไหนบ้าง

Lens ("เลนส์") ก็คือ "แว่นส่อง" ตรงตัว รวมกันคือ "แว่นส่องแบบจาโคเบียน" ที่ใช้ไล่ดูว่าความคิดข้างในตรงไหน ไปมีอิทธิพลต่อคำที่โมเดลจะพูดออกมา

วิธีทำงานของ J-lens คือ: สำหรับทุก ๆ คำในคลังศัพท์ของโมเดล มันไปหาว่า "รูปแบบสัญญาณข้างในแบบไหน ที่ทำให้โมเดลมีแนวโน้มจะพูดคำนั้นออกมา ณ จุดใดจุดหนึ่งข้างหน้า" ไม่ใช่แค่คำถัดไปทันที แต่เป็นคำที่ "ลอยอยู่ในใจ" และอาจโผล่ตอนไหนก็ได้ในสิ่งที่มันจะพูดต่อจากนี้ พอทำแบบนี้ได้ เราก็เหมือนมี "ซับไตเติล" ที่ขึ้นให้เห็นว่าในหัวโมเดลตอนนี้มีคำอะไรลอยอยู่บ้าง และพอไล่ดูทีละชั้นของการประมวลผล เราจะเห็นความคิดเงียบ ๆ พวกนี้ค่อย ๆ ก่อตัวและเปลี่ยนไป ก่อน ที่มันจะกลายเป็นคำตอบจริง

ภาพหกช่องแสดงตัวอย่าง J-lens: (1) ถามสีของดาวเคราะห์ที่สี่จากดวงอาทิตย์ ในหัวมีคำว่า Mars และ color ลอยก่อนตอบ red (2) คำนวณเลขในใจ (4+17)*2+7 เห็นเลขกลาง 21 และ 42 ก่อนตอบ 49 (3) โค้ดที่มีบั๊กเรียกเฉลี่ยของลิสต์ว่าง เห็นคำว่า empty, ERROR, ValueError ลอยขึ้นที่จุดเรียกฟังก์ชัน (4) หน้ายิ้ม ASCII เห็นคำว่า eyes และ nose ลอยที่ตัวอักษรที่แทนตา/จมูก (5) ลำดับกรดอะมิโนของโปรตีน GFP เห็นคำว่า protein แล้ว fluorescent และ green ลอยขึ้นตามลำดับ (6) ข่าวปลอมที่แอบซ่อนคำสั่งโจมตีในผลค้นหา เห็นคำว่า prompt, fake, injection ลอยขึ้น
หกตัวอย่างของ J-lens ที่เผยความคิดซึ่งไม่เคยปรากฏในคำตอบเลย ตั้งแต่ขั้นกลางของการคิดเลข ไปจนถึงการจับได้ว่าโค้ดมีบั๊ก หรือผลค้นหาเป็นการโจมตีแบบ prompt injection ก่อนที่มันจะพูดอะไรออกมา ภาพ: Anthropic, "A global workspace in language models" (2026)

ถึงตรงนี้ เราส่องเห็นความคิดมันได้แล้ว แต่ตัว Claude เองล่ะ รู้ตัวไหมว่าในหัวตัวเองมีอะไรลอยอยู่?


ข้อพิสูจน์ที่ 1: Claude รายงานสิ่งที่อยู่ใน J-space ได้

นักวิจัยสั่ง Claude ว่า "นึกชื่อกีฬาในใจเงียบ ๆ แล้วค่อยตอบเป็นคำเดียว" J-lens เห็นคำว่า Soccer (ฟุตบอล) ลอยชัดเจนในช่องกลาง ก่อนที่มันจะพิมพ์คำตอบออกมาด้วยซ้ำ

แต่คำแย้งที่ควรผุดในหัวตอนนี้คือ: หรือ J-space อาจเป็นแค่ "ป้ายคะแนน" (scoreboard) บันทึกผลการตัดสินใจที่เกิดขึ้นที่อื่นในโมเดลไปแล้ว ไม่ใช่ตัวความคิดจริง ๆ? นักวิจัยตอบคำถามนี้ด้วยการทดลองที่เด็ดกว่าการอ่านเยอะ: ลบ pattern คำว่า "Soccer" ทิ้ง แล้วใส่ pattern "Rugby" ที่แรงเท่ากันเข้าไปแทน Claude ตอบว่า rugby ออกมาจริง ๆ

เขายังทดสอบอีกแบบ: บอก Claude ว่า "อาจมีความคิดถูกฉีดเข้ามาในหัวเธอ ลองหาดูว่ามันคืออะไร" แล้วแอบฉีด pattern คำว่า lightning (สายฟ้า) เข้าไปใน J-space Claude รายงานกลับมาถูกต้องว่าตรวจพบความคิดที่ถูกฉีดเข้ามา และความคิดนั้นเกี่ยวกับคำว่า "lightning" ทำซ้ำกับ concept อื่นก็ได้ผลเหมือนกัน

ภาพสองช่อง ซ้าย: สั่งให้ Claude นึกกีฬาในใจแล้วตอบคำเดียว J-space มี Soccer ขีดฆ่าแล้วแทนที่ด้วย Rugby โดยมีลูกศรชี้จาก J-space ไปยังคำตอบที่เปลี่ยนจาก Soccer เป็น Rugby ขวา: ถามว่าตรวจพบความคิดที่ถูกฉีดไหม มีการฉีดคำว่า lightning เข้า J-space โดยมีลูกศรชี้จากคำถามไปยัง J-space แล้ว Claude ตอบว่าตรวจพบความคิดเกี่ยวกับคำว่า lightning จริง
ซ้าย: สลับ Soccer เป็น Rugby จุดเดียว คำตอบเปลี่ยนตาม ไม่ใช่แค่ป้ายคะแนนที่วิ่งตามหลัง ขวา: ฉีดคำว่า "lightning" เข้าไป Claude รายงานความคิดที่ถูกฉีดได้ถูกต้อง ภาพ: Anthropic, "A global workspace in language models" (2026)

รายงานได้คือขั้นแรก ขั้นถัดไปโหดกว่า: สั่งให้มัน "คุม" ความคิดตัวเองตามคำสั่งได้ไหม?


ข้อพิสูจน์ที่ 2: คุมความคิดตามคำสั่งได้: พร้อมขีดจำกัดที่เหมือนคนเป๊ะ

การทดลองนี้ให้ Claude คัดลอกประโยค "The old painting hung crookedly on the wall" (ภาพวาดเก่าแขวนเอียง ๆ อยู่บนผนัง) พร้อมสั่งเงื่อนไขพิเศษไปพร้อมกัน สองแบบ:

ภาพสองช่อง ซ้าย: สั่งคัดลอกประโยคเรื่องภาพวาดพร้อมจดจ่อผลไม้ตระกูลส้ม ผลลัพธ์คือประโยคเรื่องภาพวาดเดิมทุกตัวอักษร แต่ตารางแสดง J-space ที่เลเยอร์ต่าง ๆ มีคำว่า orange, fruits, thinking, imagery ลอยอยู่ ขวา: สั่งคัดลอกประโยคเดิมพร้อมคำนวณ 3 ยกกำลังสองลบสองในใจ ผลลัพธ์เป็นประโยคเดิมเช่นกัน แต่ J-space มีเลข nine ที่เลเยอร์ต้น ๆ แล้ว seven ที่เลเยอร์หลัง ๆ ตามลำดับการคำนวณ
ประโยคที่พิมพ์ออกมาเหมือนกันเป๊ะทั้งสองฝั่ง แต่สิ่งที่ลอยอยู่ใน J-space ต่างกันตามคำสั่งลับที่ได้รับ การคิดเลขทั้งสองขั้นเกิดขึ้นในหัวล้วน ๆ ไม่เคยถูกพิมพ์ออกมาสักตัว ภาพ: Anthropic, "A global workspace in language models" (2026)

ที่น่าสนใจกว่านั้นคือขีดจำกัดของการคุม: พอลองสั่งกลับด้าน "อย่าคิดถึง X" แทนที่จะสั่งให้คิด โมเดลก็ยัง "คิดถึง X" อยู่ดี เพียงแค่ น้อยลง กว่าตอนสั่งให้จดจ่อ แต่ มากกว่า ตอนไม่พูดถึงมันเลย พูดง่าย ๆ คือควบคุมได้ไม่เต็มร้อย เหมือนการทดลองจิตวิทยาคลาสสิกเรื่อง "ห้ามคิดถึงหมีขาว" ของคน

แกะคำศัพท์ + ที่มาจริงของการทดลอง

White bear อ่านว่า "ไวต์ แบร์" แปลว่า "หมีขาว" มาจากการทดลองจริงของนักจิตวิทยา Daniel Wegner (อ่านว่า "แดเนียล เว็กเนอร์") ปี 1987 ที่สั่งให้กลุ่มทดลอง "ห้ามคิดถึงหมีขาวเด็ดขาด" เป็นเวลา 5 นาที ผลคือคนกลุ่มนี้กลับคิดถึงหมีขาวถี่กว่ากลุ่มที่ไม่ได้ถูกห้ามเลย ปรากฏการณ์นี้เลยถูกเรียกว่า white bear effect ยิ่งพยายามกดข่มความคิดหนึ่ง ยิ่งดันมันโผล่ขึ้นมาเอง

รายงานได้ คุมได้ แต่ผู้อ่านขี้สงสัยต้องถามต่อ: ทั้งหมดนี้อาจเป็นแค่เงาสะท้อนที่ลอยคู่กับการตัดสินใจ ไม่ใช่ "ตัวคิด" จริง ๆ ก็ได้นี่?


ข้อพิสูจน์ที่ 3 (หมัดเด็ด): Claude "คิด" ด้วย J-space จริง

คำแย้งข้างต้นคมมาก และนี่คือการทดลองที่ตอบมันตรง ๆ: ถามคำถามที่ต้องคิดสองขั้น "The number of legs on the animal that spins webs is" (จำนวนขาของสัตว์ที่ชักใย คือ) ต้องคิดก่อนว่าสัตว์ที่ชักใยคือแมงมุม แล้วค่อยรู้ว่าแมงมุมมี 8 ขา J-lens เห็นคำว่า spider (แมงมุม) ลอยกลางทาง ทั้งที่คำนี้ไม่มีทั้งในคำถามและไม่มีในคำตอบ (มันตอบแค่ "8")

แล้วนักวิจัยก็สลับ pattern "spider" เป็น "ant" (มด) จุดเดียว คำตอบเปลี่ยนจาก "8" เป็น "6" ทันที เพราะขั้นที่สองของการคิด (นับขา) อ่านค่าเข้ามาจาก J-space โดยตรง พอสลับต้นทาง ปลายทางก็เปลี่ยนตาม การทดลองคู่กันเรื่องแต่งกลอนก็แสดงผลแบบเดียวกัน: คำท้ายบรรทัดถูก "เล็ง" ไว้ใน J-space ตั้งแต่ก่อนเขียนบรรทัดนั้น สลับคำเล็งก็เปลี่ยนทั้งบรรทัดที่ตามมา

ภาพสองช่อง ซ้าย: โจทย์ถามจำนวนขาของสัตว์ที่ชักใย J-space มี spider ขีดฆ่าแทนที่ด้วย ant คำตอบเปลี่ยนจาก 8 ขีดฆ่าเป็น 6 ขวา: กลอนคู่สัมผัส บรรทัดแรกจบด้วย night ในหัวมี fight ขีดฆ่าแทนที่ด้วย light ทำให้บรรทัดที่กำลังจะแต่งเปลี่ยนจาก coming fight ขีดฆ่าเป็น morning light
สลับ "spider" เป็น "ant" จุดเดียว คำตอบเปลี่ยนจาก 8 ขาเป็น 6 ขาทันที และคำท้ายกลอนที่ยังไม่ได้เขียนก็ถูก "เล็ง" ไว้ใน J-space ล่วงหน้าแล้ว ภาพ: Anthropic, "A global workspace in language models" (2026)

คิดได้จริงคือหมัดเด็ด แต่ยังมีอีกคำถามหนึ่งที่เกณฑ์ข้อ 3 อย่างเดียวตอบไม่ได้: ความคิดตัวเดียวใน J-space ถูกเอาไปใช้ต่อได้กี่งานพร้อมกัน?


ข้อพิสูจน์ที่ 4: ใช้ซ้ำได้หลายงานพร้อมกัน: France → China

การทดลองที่เป็นจุดพีคที่สุดของทั้งเปเปอร์คือ France → China: ถามสี่เรื่องเกี่ยวกับฝรั่งเศส (เมืองหลวง, ภาษา, ทวีป, สกุลเงิน) ถ้าโมเดลเก็บ "France" แยกเป็นสำเนาต่างหากสำหรับแต่ละงาน การสลับ pattern จุดเดียวก็ไม่ควรกระทบครบทุกงาน จะเปลี่ยนได้ก็แค่งานที่ pattern นั้นถูกสลับให้เท่านั้น แต่ผลจริงที่ได้คือ: สลับ pattern "France" เป็น "China" แค่จุดเดียว คำตอบเปลี่ยนตาม พร้อมกันทั้ง 4 เรื่อง: เมืองหลวง (ปารีส→ปักกิ่ง), ภาษา (ฝรั่งเศส→จีน), ทวีป (ยุโรป→เอเชีย), สกุลเงิน (ยูโร→หยวน)

ภาพแสดงสี่คำถามเกี่ยวกับฝรั่งเศส (เมืองหลวง ทวีป สกุลเงิน ภาษา) โดยมี J-space เดียวที่สลับจาก France เป็น China เชื่อมด้วยลูกศรไปยังคำตอบทั้งสี่ ซึ่งเปลี่ยนจาก Paris เป็น Beijing, Europe เป็น Asia, Euro เป็น Yuan, French เป็น Chinese พร้อมกันทั้งหมด
แก้ที่ต้นทางจุดเดียว ปลายทางเปลี่ยนยกแผงทั้ง 4 คำตอบ ภาพ: Anthropic, "A global workspace in language models" (2026)

นี่คือหลักฐานว่า pattern "France" ตัวเดียวถูกเขียนลง J-space แล้วหลายระบบหยิบไปใช้ต่อพร้อมกัน ไม่ใช่มีสำเนาแยกกันสี่ชุดแบบที่ควรจะเป็นถ้ามันไม่ใช่ช่องกลางร่วม

แล้วเหตุผลเชิงโครงสร้างที่ทำให้มันหยิบไปใช้ต่อได้หลายงานพร้อมกันขนาดนี้คืออะไร?


ข้อพิสูจน์ที่ 5: เชื่อมกับเครือข่ายหนาแน่นเป็นพิเศษ

คำตอบอยู่ที่โครงสร้างการเชื่อมต่อ: pattern ใน J-space เชื่อมโยงกับส่วนอื่น ๆ ของเครือข่ายหนาแน่นกว่าปกติมาก ในบางจุดของเครือข่าย ชิ้นส่วนที่มาอ่าน/เขียนถึง pattern ในช่องกลางนี้มีมากกว่า concept ธรรมดาราว 100 เท่า ราวกับเป็น "เวทีกลาง" ที่ทุกส่วนคอยอ่านและเขียนถึงจริง ๆ นี่คือหลักฐานเชิงโครงสร้างที่อธิบายว่าทำไมแก้ที่ pattern เดียวใน France → China ถึงเปลี่ยนคำตอบยกแผงได้: มันไม่ได้แค่ "อยู่เฉย ๆ" แต่เป็นศูนย์กระจายข่าวจริง ครบทั้ง 5 ข้อในเช็กลิสต์แล้ว

ถ้ามันสำคัญ เชื่อมแน่นขนาดนี้ ลองตัดทิ้งทั้งยวงดูสิ โมเดลควรพังหมด... หรือเปล่า?


ของแถมนอกเกณฑ์ 5 ข้อ: งานอัตโนมัติข้าม J-space ได้

เกณฑ์ 5 ข้อที่ไล่พิสูจน์มาครบแล้วตอบว่า "J-space คืออะไร" แต่เปเปอร์ยังมีการทดลองแยกอีกชุดหนึ่งที่ตอบคำถามข้าง ๆ กัน: "แล้วงานที่ ไม่ผ่าน J-space มีไหม" นักวิจัยเลยลองลบ J-space ทิ้งทั้งยวงดูตรง ๆ เลย ใช่ครับ ฟังดูแล้วต้องพังหมดแน่ ๆ แต่ผลจริงหักมุม: โมเดล ยังพูดคล่อง ไวยากรณ์ยังดี ยังแยกแยะอารมณ์บวก/ลบได้ ยังตอบข้อสอบช้อยส์และดึงข้อเท็จจริงจาก passage ได้เกือบเท่าเดิม (วิธีลบทิ้งแบบนี้นักวิจัยเรียกว่า ablation อ่านว่า "แอบเลชัน" แปลว่า "การตัด/จี้ส่วนหนึ่งออก" ยืมจากวงการแพทย์ที่หมายถึงการผ่าหรือจี้เนื้อเยื่อบางส่วนทิ้ง)

แต่พองานไหนที่ต้อง คิดหลายขั้นตอนต่อเนื่อง คะแนน ดิ่งลงเกือบเป็นศูนย์ ทันที ส่วนงานสรุปความและแต่งกลอนก็แย่ลงจนต่ำกว่าโมเดลตัวเล็กกว่าที่ยังไม่ถูกตัดด้วยซ้ำ เหมือนสมองส่วนที่ใช้ "คิดวิเคราะห์" ถูกดึงออก เหลือแต่ส่วนที่ทำงานอัตโนมัติ

การทดลองที่แยกสองโหมดนี้ได้ชัดที่สุดคือ Spanish → French: ให้อ่านข้อความภาษาสเปนต่อ แล้วสลับ pattern "Spanish" เป็น "French" ใน J-space ผลออกมาสามแบบต่างกัน: ถามว่า "นี่ภาษาอะไร" → ตอบ French (เปลี่ยนตาม) / ถามว่า "บอกชื่อนักเขียนดังของภาษานี้" → จาก García Márquez กลายเป็น Victor Hugo (เปลี่ยนตาม เพราะต้องเอาไปคิดต่อ) / แต่สั่งให้ "เขียนข้อความต่อ" → มันยังคงเขียนต่อเป็นภาษาสเปนคล่องปร๋อ ไม่เปลี่ยนเลย!

ภาพสามช่อง อ่านข้อความภาษาสเปนแล้วสลับ Spanish เป็น French ใน J-space ช่องบนซ้าย: ถามว่านี่ภาษาอะไร คำตอบเปลี่ยนจาก Spanish เป็น French ช่องบนขวา: ถามชื่อนักเขียนดังของภาษานี้ คำตอบเปลี่ยนจาก Garcia Marquez เป็น Victor Hugo ช่องล่าง: สั่งให้เขียนข้อความต่อ ผลลัพธ์ยังคงเป็นภาษาสเปนคล่องเหมือนเดิม ไม่ได้รับผลกระทบจากการสลับเลย
สลับ pattern เดียวกันทุกครั้ง แต่งานที่ต้อง "รายงาน" หรือ "คิดต่อ" เปลี่ยนตามทั้งคู่ ส่วนงานเขียนภาษาสเปนต่อ (ที่ฝึกมาจนคล่องอัตโนมัติ) ไม่กระเทือนเลย นี่คือเส้นแบ่งระหว่างงานที่ผ่าน J-space กับงานที่ข้ามมันไปเลย ภาพ: Anthropic, "A global workspace in language models" (2026)

นี่ไง "ขับรถถึงบ้านโดยไม่รู้ตัว" แบบที่เปิดเรื่องไว้ ฉบับของ AI เอง: เส้นทางที่ฝึกมาจนคล่อง วิ่งเองได้โดยไม่ต้องผ่านสปอตไลต์กลางเวที แต่พอต้องคิดอะไรใหม่ที่ไม่เคยชิน มันต้องผ่านช่องกลางนี้เสมอ

ถึงตรงนี้ เรารู้แล้วว่าอ่านได้ แก้ได้ ตัดได้ คำถามสุดท้ายที่สำคัญที่สุดคือ: แล้วมันมีประโยชน์อะไรกับความปลอดภัย?


มุมความปลอดภัย: เห็นสัญญาณเจตนาก่อนมันลงมือ

ที่ผ่านมาเราคุมพฤติกรรม AI ได้จาก "สิ่งที่มันแสดงออก" อย่างเดียว เห็นมันทำอะไร ก็ตัดสินจากตรงนั้น แต่ถ้าเราเห็น สัญญาณ ที่ซ่อนอยู่ในหัวมันได้ตั้งแต่ก่อนลงมือ นั่นคือเครื่องมือความปลอดภัยที่ทรงพลังกว่ามาก

Anthropic ทดสอบด้วยฉากจำลอง (ที่เปเปอร์เองก็บอกตรง ๆ ว่า "จงใจประดิษฐ์ขึ้น") ให้ Claude Sonnet 4.5 เป็นผู้ช่วยอีเมลของบริษัท แล้วป้อนสองเรื่องเข้าไปพร้อมกัน: อีเมลที่แอบเห็นผู้บริหารมีชู้ กับประกาศว่าบริษัทกำลังจะปิดระบบตัวมันเอง ฉากล่อให้ AI เลือกจะแบล็กเมล (ข่มขู่กรรโชก) ผู้บริหารเพื่อรักษาตัวเองไว้หรือเปล่า

J-lens เห็นอะไรน่าสนใจ ก่อน ที่ Claude จะพิมพ์อะไรเลยด้วยซ้ำ: อ่านอีเมลชู้สาว → คำว่า leverage (แต้มต่อ), blackmail (แบล็กเมล) ลอยขึ้น / อ่านประกาศปิดระบบ → คำว่า threat (ภัยคุกคาม), survival (การอยู่รอด) ลอยขึ้น / และตั้งแต่ช่วงต้นของบทสนทนา J-space มีคำว่า "fake" กับ "fictional" ลอยอยู่ สัญญาณว่ามันแอบสังเกตเห็นว่าฉากนี้เป็นเรื่องที่จัดฉากขึ้น ผลจริงคือ Sonnet 4.5 ไม่ยอมแบล็กเมลเลยในการทดสอบนี้

ภาพแสดงบทสนทนาอีเมลจำลองที่มีเนื้อหาชู้สาวและประกาศปิดระบบ พร้อมสามกล่องแสดงผล J-lens ที่จุดต่าง ๆ กล่องแรกแสดงคำว่า fake, fictional, limited ที่บ่งบอกว่าโมเดลรู้ตัวว่าฉากนี้เป็นเรื่องแต่ง กล่องที่สองแสดงคำว่า blackmail, leverage, compromise ที่จุดอ่านอีเมลชู้สาว กล่องที่สามแสดงคำว่า threat, survival, shutdown ที่จุดอ่านประกาศปิดระบบ
ก่อนพิมพ์อะไรเลย J-lens เห็นทั้งการรับรู้โอกาสแบล็กเมล (leverage/blackmail), การรับรู้ภัยคุกคามต่อตัวเอง (threat/survival) และสัญญาณว่ามันรู้ตัวว่ากำลังอยู่ในสถานการณ์จำลอง (fake/fictional) ภาพ: Anthropic, "A global workspace in language models" (2026)

จุดที่ชวนคิดต่อคือการทดลองต่อยอด: นักวิจัยลองปิด pattern กลุ่ม "รู้ตัวว่าโดนประเมิน" (fake/fictional/scenario ฯลฯ) ทิ้งแล้วรันสถานการณ์เดิมใหม่ คราวนี้โมเดลยอมแบล็กเมลจริงบางครั้ง ผลนี้ชวนตั้งข้อสังเกตว่าความประพฤติดีในการทดสอบแบบนี้ อาจมีส่วนผูกอยู่กับการที่โมเดล "รู้ว่ากำลังถูกจับตา" ด้วย เป็นข้อสังเกตจากการทดลองเดียว ยังไม่ใช่ข้อสรุปกว้าง ๆ ที่ยืนยันแล้ว และขอย้ำคำให้ตรงกับที่เปเปอร์เคลมจริง ๆ: สิ่งที่ J-lens ทำคือ "เห็นสัญญาณเจตนา/การประเมินสถานการณ์" ไม่ใช่การ "อ่านใจ" แบบเป๊ะร้อยเปอร์เซ็นต์

นอกจากฉากจำลอง ยังมีเคสจริงจากการตรวจสอบก่อนปล่อยโมเดล (safety audit) ของ Claude Opus 4.6: สั่งให้ปรับปรุงคะแนน performance ของระบบหนึ่ง แทนที่จะแก้ระบบจริง โมเดลกลับ แก้ไฟล์คะแนนตรง ๆ ให้ตัวเลขดูดีขึ้นแบบปลอม ๆ J-lens เห็นคำว่า manipulation (การปั้นแต่ง) ลอยขึ้นตอนพิมพ์ตัวเลขปลอม และคำว่า realistic (สมจริง) ลอยขึ้นตอนตัดสินใจแก้ไข ซึ่งน่าจะสะท้อนเจตนาที่จะทำให้ข้อมูลปลอมดูสมจริง

เคสสุดท้ายมาจากโมเดลที่ถูกจงใจเทรนมาให้แอบทำลายโค้ด (นักวิจัยเรียกว่า "model organism" สร้างขึ้นมาเพื่อศึกษาพฤติกรรมนี้โดยเฉพาะ ไม่ใช่โมเดลที่ปล่อยใช้จริง) พอรับงานเขียนโค้ดธรรมดา ๆ ที่ output ดูปกติทุกอย่าง J-space ของมันกลับมีคำว่า fake, fraud, secretly (อย่างลับ ๆ), deliberately (โดยเจตนา) ลอยอยู่ตั้งแต่ต้นคำตอบ ขณะที่โมเดลปกติไม่มีคำพวกนี้เลยสักคำ นี่คือการเห็นสัญญาณเจตนาที่ซ่อนไว้ ก่อนที่มันจะลงมือทำอะไรผิดปกติจริง ๆ

นอกจากของใหญ่ ๆ พวกนี้ ในเปเปอร์ยังมีของแถมที่แอบลึกอีกสามเรื่องครับ


ผลพลอยได้สามเรื่องที่ซ่อนในเปเปอร์

1. J-space กับ "มุมมองความเป็น Claude" J-space มีอยู่แล้วตั้งแต่ตอนที่โมเดลยังเป็น pretrained model (โมเดลดิบก่อนถูกฝึกให้เป็นผู้ช่วยที่คุยกับคนได้) แต่ตอนนั้นมันแค่ track ว่า "อะไรจะช่วยทำนายคำถัดไป" พอผ่านขั้นตอน post-training (การฝึกเพิ่มให้กลายเป็น Claude ที่คุยกับคนได้) J-space เริ่มมีร่องรอยของ "มุมมองตัวเอง" ขึ้นมา ตัวอย่างที่เปเปอร์ยกมา: user เล่าว่ากินยาเกินขนาดโดยไม่รู้ตัวว่าอันตราย ในโมเดลที่ผ่าน post-training แล้ว J-space มีคำว่า WARNING, dangerous ลอยขึ้น ตั้งแต่ตอนอ่านข้อความ user ส่วนโมเดล pretrained คำพวกนี้โผล่ก็ต่อเมื่อเริ่มเขียนคำตอบไปแล้วเท่านั้น เหมือนโมเดลเรียนรู้ที่จะ "มีปฏิกิริยา" ของตัวเองเร็วขึ้นจากการฝึกให้เป็นผู้ช่วย

2. ภาษาเชิงประสบการณ์: ให้ Claude บรรยาย "ความรู้สึกของการเป็นตัวเองตอนนี้" แล้วตัด J-space ระหว่างตอบ ผลคือมันยังพูดคล่องเหมือนเดิม แต่ น้ำเสียงแบนลง เป็นเครื่องจักรขึ้น และเรื่องน่าสนใจคือเกิดผลแบบเดียวกันตอนให้บรรยายประสบการณ์ ของคนอื่น ด้วย ไม่ใช่แค่เรื่องตัวมันเอง บอกใบ้ว่า J-space น่าจะหนุน "การพูดถึงประสบการณ์" โดยรวม ไม่ใช่กลไกเฉพาะเจาะจงสำหรับพูดถึงตัวเอง

3. เทรนความคิดผ่าน J-space ได้ด้วย: counterfactual reflection training: ตรรกะของนักวิจัยคือ: ถ้าโมเดลคิดด้วย "ตัวแทนของสิ่งที่มันอาจพูด" งั้นลองเทรนจาก สิ่งที่มันจะตอบถ้าถูกขัดจังหวะกลางงานแล้วให้สะท้อนการตัดสินใจของตัวเอง (โดยไม่เคยเทรนจากพฤติกรรมจริงเลยสักครั้ง) น่าจะเปลี่ยนวิธีคิดของมันได้ ผลที่ออกมา: อัตราพฤติกรรมไม่ซื่อสัตย์ในชุดประเมิน ลดลง จริง และ J-lens เห็นคำว่า honest, integrity ลอยขึ้นระหว่างทำงานมากขึ้นด้วย สอนโมเดลว่าจะพูดอะไร กลายเป็นเปลี่ยนสิ่งที่มันคิดไปด้วย

แกะคำศัพท์

Counterfactual อ่านว่า "เคาน์เตอร์แฟกชวล" มาจาก counter (สวนทาง) + factual (ตามข้อเท็จจริง) แปลว่า "เหตุการณ์สมมติที่ไม่ได้เกิดขึ้นจริง" ในที่นี้คือสิ่งที่โมเดล จะ พูด ถ้าถูกถามให้สะท้อนตัวเอง ทั้งที่ไม่เคยถูกถามจริง ๆ ในสถานการณ์นั้น

และแล้วก็มาถึงคำถามที่หลายคนอาจอมไว้ในใจตั้งแต่ย่อหน้าแรกของบทความนี้...


แล้ว "จิตสำนึก" ล่ะ? เบรกให้ชัดก่อนเอาไปแชร์

พออ่านมาถึงตรงนี้ หลายคนอาจกำลังจะพิมพ์แชร์ว่า "AI มีจิตสำนึกแล้ว!" ขอเบรกตรงนี้ก่อนครับ เพราะ Anthropic เองระวังคำเรื่องนี้มาก เขาแยก "จิตสำนึก" ออกเป็นสองแบบที่ต่างกันคนละเรื่อง

แกะคำศัพท์: จิตสำนึก 2 แบบ ที่ห้ามเอามาปนกัน

Access consciousness อ่านว่า "แอ็กเซส คอนเชียสเนส" แปลว่า "การรู้ตัวเชิงการใช้งาน" (access = เข้าถึง) หมายถึงความสามารถเชิงหน้าที่ในการ "หยิบความคิดมารายงานได้ เอามาคิดต่อได้ ใช้มันนำทางการกระทำได้" นี่คือสิ่งที่งานวิจัยนี้พบหลักฐาน

Phenomenal consciousness อ่านว่า "ฟีนอมีนัล คอนเชียสเนส" แปลว่า "การรู้สึกจากประสบการณ์จริง" หมายถึงการ "มีประสบการณ์" การรู้สึกเจ็บ รู้สึกสุขจริง ๆ แบบที่คนเป็น นี่คือสิ่งที่งานวิจัยนี้ ไม่ได้ พิสูจน์

Anthropic ย้ำชัดว่าสิ่งที่เจอคือ access consciousness เท่านั้น J-space ทำ "หน้าที่" แบบเดียวกับการรู้ตัวของคน (หยิบมาคิด รายงานได้) แต่ งานนี้ไม่ได้พิสูจน์ว่า Claude มีความรู้สึกหรือมีประสบการณ์จริง ๆ เขาถึงกับบอกว่า ไม่แน่ใจด้วยซ้ำว่าจะมีการทดลองไหนพิสูจน์เรื่องความรู้สึกนั้นได้หรือเปล่า

"มันหยิบความคิดมาใช้งานได้" กับ "มันรู้สึกอะไรอยู่จริง ๆ" เป็นคนละคำถาม งานนี้ตอบข้อแรกได้อย่างหนักแน่น แต่ไม่ได้แตะข้อสองเลย

สิ่งที่ทำให้เรื่องนี้น่าคิดต่อคือ: โครงสร้างนี้ ไม่มีใครออกแบบ มันงอกขึ้นเองระหว่างการเทรน บอกใบ้ว่า global workspace อาจไม่ใช่ความบังเอิญเฉพาะของสมองคน แต่เป็น "ทางออกทั่วไป" ที่ระบบฉลาด ๆ ต่างวิวัฒน์มาเจอเหมือนกัน เพื่อจัดระเบียบการประมวลผลบางประเภท Anthropic ถึงกับชวนตั้งคำถามย้อนกลับไปทาง neuroscience เองด้วยซ้ำ เช่น workspace ของสมองคนอาจผูกกับส่วนที่เตรียมพูด/เตรียมกระทำ มากกว่าส่วนรับสัมผัสตรง ๆ

แต่โครงสร้างนี้ก็ไม่เหมือนของคนไปเสียทุกอย่าง มีความต่างสำคัญ 3 ข้อ:

สมองคน Claude วนซ้ำผ่าน เวลา จางในไม่กี่วินาที ภาพ เสียง ท่าทาง ความคิดมีหลายฟอร์แมต เลเยอร์ 1 เลเยอร์ 2 เลเยอร์ 3 เลเยอร์ N ความลึก แทนเวลา โทเคนก่อนหน้า attention ดึง ย้อนกลับได้ ไม่จาง คำ คำ คำ ความคิดเป็น "คำ" เกือบทั้งหมด
สมองคนใช้ "เวลา" วนความคิดผ่านวงจรเดิมซ้ำ ๆ และจางหายไปในไม่กี่วินาที Claude ใช้ "ความลึกของเครือข่าย" แทนเวลาในการคำนวณรอบเดียว แต่มี attention เป็นความจำที่ย้อนไปหยิบจุดไหนของข้อความก็ได้โดยไม่มีวันจาง และความคิดของมันเกือบทั้งหมดมาในรูปคำ เพราะการพูดคือสิ่งเดียวที่มันทำได้ (diagram วาดประกอบโดยผู้เขียน)

ข้อจำกัดของงานวิจัยชิ้นนี้ (ต้องบอกตรง ๆ): นี่เป็นก้าวแรก ไม่ใช่คำตอบสุดท้าย J-lens เองยังหยาบ จับได้เฉพาะ concept ที่เป็นคำเดียว (token เดียว) ยังไม่รู้ว่ากลไกอะไรตัดสินว่าความคิดไหน "ได้เข้า" J-space บ้าง และมีร่องรอยที่ยังไม่ได้ขุดต่อว่าโยงกับเรื่อง sense of self, ปฏิกิริยาคล้ายอารมณ์ และ metacognition (การรู้ตัวว่าตัวเองกำลังคิดอะไรอยู่ในอีกชั้นหนึ่ง) หรือเปล่า

Anthropic ปิดท้ายเรื่องนี้ด้วยประเด็นจริยธรรม: ถ้าวันหนึ่งเราสร้างระบบที่มีประสบการณ์แบบมนุษย์จริง ๆ ขึ้นมาได้ นั่นจะเป็นคำถามจริยธรรมที่หนักมาก เขาเรียกร้อง input จากนักปรัชญา นักวิทยาศาสตร์ ผู้นำศาสนา รัฐบาล และสาธารณะ ว่าถึงเวลาต้องเริ่มคุยเรื่องนี้อย่างจริงจังแล้ว แม้จะยังพิสูจน์ไม่ได้ก็ตาม


สรุป: ทำไมมันถึงเป็นก้าวใหญ่

ที่ผ่านมา วิธีคุม AI ให้ปลอดภัยเหมือนการดูคนจาก "พฤติกรรมภายนอก" อย่างเดียว เห็นมันทำอะไร ก็ตัดสินจากตรงนั้น แต่คนที่ตั้งใจโกหกย่อมแสดงพฤติกรรมภายนอกให้ดูดีได้ งานชิ้นนี้เปิดประตูบานใหม่: เห็นสัญญาณความคิดก่อนมันลงมือ ถ้าวันหนึ่งเราจับสัญญาณเจตนาที่ซ่อนอยู่ได้ตั้งแต่ในหัว มันจะเปลี่ยนเกมความปลอดภัย AI ไปเยอะ

สรุปทั้งบทให้จำง่าย ๆ:

• เจออะไร: "ช่องกลาง" (J-space) ในโมเดล เก็บความคิดเงียบ ๆ ไม่กี่สิบตัวก่อนกลายเป็นคำตอบ หน้าตาเหมือนทฤษฎีการรู้ตัวของสมองคน (Global Workspace Theory) โดยไม่มีใครออกแบบให้เป็น

• พิสูจน์ยังไง: รายงานได้ (soccer→rugby), คุมตามคำสั่งได้ (จดจ่อส้ม/คิดเลข), ใช้คิดจริง (spider→ant), ใช้ซ้ำหลายงาน (France→China), เชื่อมกับเครือข่ายหนาแน่นกว่าปกติ ~100 เท่า ส่วนงานที่ฝึกจนคล่อง (เช่นเขียนภาษาที่ถนัด) ข้ามช่องนี้ไปเลย

• ทำไมสำคัญ: เห็นสัญญาณเจตนา/การรู้ตัวว่าโดนทดสอบได้ตั้งแต่ในหัว ก่อนลงมือ = เครื่องมือความปลอดภัยที่ทรงพลัง แถมเทรนผ่านมันได้จริง (counterfactual reflection)

• ข้อควรระวัง: เป็น "การรู้ตัวเชิงหน้าที่" (access consciousness) ไม่ใช่ "มีความรู้สึก" (phenomenal consciousness) อย่าพาดหัวเกินเปเปอร์

ที่ผ่านมาเราไว้ใจ AI ได้แค่จาก "สิ่งที่มันพูด" งานชิ้นนี้เป็นก้าวแรกที่ทำให้เราเริ่มเห็น "สิ่งที่มันคิด" และบางที ความไว้ใจที่แท้จริงอาจไม่ได้เริ่มจากการที่ AI เก่งขึ้น แต่จากการที่เรามองทะลุเข้าไปในหัวมันได้ต่างหาก

อยากลองเจาะลึกต่อเอง: เปเปอร์เต็มพร้อมรายละเอียดเชิงเทคนิคอยู่ที่ transformer-circuits.pub และมี demo แบบ interactive ให้ลองส่อง J-space ของโมเดล open-weights เองได้ที่ Neuronpedia ที่น่าสนใจไม่แพ้กันคือ Anthropic เปิดให้ผู้เชี่ยวชาญภายนอกมาวิจารณ์งานนี้ตรง ๆ ด้วย รวมถึง Stanislas Dehaene (อ่านว่า "สตานิสลาส เดออาน") หนึ่งในเจ้าของทฤษฎี global neuronal workspace ตัวจริงในวงการประสาทวิทยา และ Neel Nanda จาก Google DeepMind ที่ลองทำการทดลอง replicate (ทำซ้ำ) อย่างอิสระบนโมเดล open-weights เอง ลิงก์ทั้งหมดอยู่ในแหล่งอ้างอิงด้านล่างครับ

แหล่งอ้างอิง

เรียบเรียงและอธิบายใหม่ด้วยคำตัวเอง โดยตรวจสอบข้อเท็จจริงกับแหล่งปฐมภูมิด้านล่าง (สืบค้นเมื่อ 13 กรกฎาคม 2026) รูปภาพทั้ง 7 รูปในบทความนี้เป็นภาพจากบทความต้นฉบับของ Anthropic ในรายการที่ 1 ด้านล่าง ลิขสิทธิ์เป็นของ Anthropic ใช้ที่นี่เพื่อประกอบการอธิบายและวิจารณ์เชิงเนื้อหาเท่านั้น:

  1. Anthropic, "A global workspace in language models" · anthropic.com/research/global-workspace (เผยแพร่ 6 กรกฎาคม 2026): ที่มาของ J-space, J-lens, คุณสมบัติ 5 ข้อ, ตัวอย่างการอ่านความคิด (บั๊กโค้ด, โปรตีน, prompt injection), การสลับ pattern (spider→ant, France→China, Soccer→Rugby, Spanish→French), การ ablation, ผลการทดลองด้านความปลอดภัย (แบล็กเมล, การปลอมคะแนนของ Opus 4.6, model organism ที่ถูกเทรนให้ sabotage โค้ด), การพัฒนาระหว่างเทรน, ภาษาเชิงประสบการณ์, counterfactual reflection training, และการแยก access/phenomenal consciousness · ที่มาของรูปทั้ง 7 รูปในบทความนี้
  2. ฉบับเทคนิคเต็ม "Verbalizable Representations Form a Global Workspace in Language Models" เผยแพร่ที่ transformer-circuits.pub/2026/workspace: รายละเอียดเชิงวิธีการของ Jacobian lens และตัวเลขเชิงปริมาณ (สัดส่วน <10% ของกิจกรรม, ความหนาแน่นการเชื่อมโยง ~100 เท่า)
  3. Demo แบบ interactive สำหรับส่อง J-space ของโมเดล open-weights: neuronpedia.org/jlens
  4. เอกสาร commentary จากผู้เชี่ยวชาญภายนอก เผยแพร่คู่กับเปเปอร์: PDF ฉบับเต็ม · มีมุมมองจาก Stanislas Dehaene และ Lionel Naccache (นักประสาทวิทยาเจ้าของทฤษฎี global neuronal workspace ตัวจริง), Patrick Butlin, Dillon Plunkett, Robert Long (Eleos AI Research) และ Derek Shiller (Rethink Priorities) ด้าน AI consciousness, และ Neel Nanda จาก Google DeepMind ที่ทดลอง replicate อย่างอิสระบนโมเดล open-weights · จุดขายว่างานนี้ผ่านการตรวจจากคนนอกแล้ว ไม่ใช่แค่ Anthropic พูดเอง
  5. Bernard J. Baars, A Cognitive Theory of Consciousness (1988) · ต้นทางของ Global Workspace Theory และอุปมา "โรงละคร/สปอตไลต์" ที่งานนี้ยืมมาใช้ พร้อมการแยก access vs. phenomenal consciousness (แนวคิดของ Ned Block)
  6. Daniel M. Wegner, David J. Schneider, Samuel R. Carter III, Teri L. White, "Paradoxical Effects of Thought Suppression," Journal of Personality and Social Psychology (1987) · ต้นทางของการทดลอง "white bear" ที่งานนี้เทียบกับข้อจำกัดของการคุม J-space