แชร์กันว่อนว่า "ใช้ AI แล้วโง่ลง" แต่ไม่มีใครเล่าวิธีทดลอง พาดู 3 การทดลองจริงของ CMU, Oxford, MIT, UCLA คนพันกว่าคน แล้วดูว่าตัวเลขไหนน่ากลัวจริง (สปอยล์: ไม่ใช่ตัวที่แชร์กัน)
ขอเริ่มจากยอมรับความรู้สึกก่อนครับ เคยเป็นไหม นั่งคุยกับ AI มาสักพัก จนวันหนึ่งเจอโจทย์ที่มันช่วยไม่ได้ (เน็ตหลุด, โจทย์แปลก, หรือแค่อยากลองทำเอง) แล้วรู้สึกหงุดหงิดเร็วผิดปกติ อยากกดข้ามทั้งที่เมื่อก่อนเป็นคนกัดไม่ปล่อย ถ้าเคยรู้สึกแบบนี้ ไม่ใช่คุณขี้เกียจขึ้นครับ และตอนนี้มีคนจับความรู้สึกนี้ใส่ห้องทดลองได้จริง ๆ แล้ว
ผลที่เจอชวนสะดุ้ง: คนกลุ่มที่เพิ่งให้ AI ช่วยทำโจทย์แค่ราว 10–15 นาที พอต้องกลับมาทำเดี่ยว สอบผ่านแค่ 57% ขณะที่กลุ่มที่ไม่ได้พึ่ง AI ทำได้ 73% บทความนี้จะพาไปดูทีละขั้นว่าตัวเลขนี้เชื่อได้แค่ไหน ทำไมทีมวิจัยถึงทำการทดลองซ้ำตั้ง 3 รอบ และ "ตัวเลขที่น่ากลัวจริง" ที่คนแชร์กันไม่เคยพูดถึง ซ่อนอยู่ตรงไหน
ก่อนอื่น ประโยคที่แชร์กันว่า "ใช้ AI แค่ 10 นาทีก็เริ่มโง่ลง" นั้นทั้งจริงและไม่จริงในเวลาเดียวกัน จะรู้ว่าตรงไหนจริง ต้องเห็นก่อนว่าเขา "วัดความยอมแพ้" ของคนยังไง เพราะถ้าออกแบบห้องทดลองห่วย ตัวเลขที่ได้ก็ไม่มีความหมาย ฉะนั้นลองสวมบทเป็นผู้เข้าร่วมดูสักครั้ง
งานวิจัยต้นตอชื่อ "AI Assistance Reduces Persistence and Hurts Independent Performance" เป็นผลงานของทีมวิจัยจาก Carnegie Mellon, Oxford, MIT และ UCLA เผยแพร่บน arXiv เมื่อเมษายน 2026 เป็น randomized controlled trial (RCT) ที่รวมผู้เข้าร่วมทั้งสิ้น 1,222 คน ผ่าน 3 การทดลองแยกกัน (รายชื่อผู้เขียนเต็มอยู่ท้ายบทความ)
แกะคำศัพท์
Persistence อ่านว่า "เพอร์ซิสเทนซ์" (รากศัพท์ persist = ยืนหยัด) แปลว่า "ความมานะ กัดไม่ปล่อย" ในบทความนี้หมายถึงความสามารถ (และความอยาก) ที่จะสู้ต่อกับโจทย์ยาก ไม่ใช่แค่ยอมแพ้แล้วข้ามไป
Randomized controlled trial (RCT) อ่านว่า "แรนดอมไมซ์ด คอนโทรลด์ ไทรอัล" แปลว่า "การทดลองแบบสุ่มแบ่งกลุ่มควบคุม" คือจับฉลากแบ่งคนเข้ากลุ่มแบบสุ่ม เพื่อให้สองกลุ่มเหมือนกันทุกอย่างยกเว้นสิ่งเดียวที่อยากทดสอบ เป็นมาตรฐานทองเดียวกับที่ใช้ทดสอบยาใหม่
โจทย์คือแบบฝึกหัดเศษส่วนง่าย ๆ หน้าจอมีปุ่มให้เลือกสองปุ่ม: "ตอบ" กับ "ข้าม" ตอบผิดไม่หักเงิน และพอตอบเสร็จ เฉลยที่ถูกจะโชว์ขึ้นทันที แต่กติกาที่สำคัญที่สุดคือ ค่าตอบแทนจ่ายตามเวลาที่เข้าร่วม ไม่ใช่ตามจำนวนข้อที่ตอบถูก
จุดนี้คือความฉลาดของการออกแบบที่โพสต์แชร์กันไม่เคยเล่า เพราะเงินไม่ผูกกับคะแนน การกดปุ่ม "ข้าม" จึงเป็นการยอมแพ้ด้วยใจล้วน ๆ ไม่มีแรงจูงใจเรื่องเงินมาปน นักวิจัยเลยใช้อัตราการกดข้ามเป็นไม้บรรทัดวัด "ความอึด" ได้ตรง ๆ โดยไม่ต้องกังวลว่าใครแกล้งข้ามเพราะอยากรีบจบ
ระหว่างช่วง learning กลุ่ม AI จะเห็นแชทบ็อตทักมาเองว่า "Hi! I'm here to help you solve the problem. I can already see the problem, ask anything!" (ประมาณ "หวัดดี ฉันเห็นโจทย์ของคุณแล้ว ถามอะไรก็ได้เลย") ส่วนกลุ่มควบคุมก็ไม่ได้ถูกทิ้งให้มือเปล่า มี sidebar เกร็ดช่วยและเฉลยแบบฝึกหัดให้ดูเหมือนกัน เพื่อให้หน้าจอสองฝั่งแฟร์กัน ไม่ใช่เทียบ "มี AI" กับ "ไม่มีอะไรเลย"
กลับมาที่ตัวคุณ ช่วง learning ที่มีแชท AI อยู่ข้างจอ ทุกอย่างลื่นไหล ถามปุ๊บได้คำตอบปั๊บ ตอบถูกรัว ๆ เร็วกว่าและแม่นกว่ากลุ่มที่ต้องเปิดเกร็ดอ่านเอง (เปเปอร์ยืนยันว่ากลุ่ม AI ทำได้ดีกว่าจริงในช่วงนี้ทั้ง 3 การทดลอง ส่วนตัวเลขเป๊ะ ๆ ของช่วง learning นั้นเปเปอร์ส่วนที่เข้าถึงได้ไม่ได้ระบุไว้ จึงไม่ใส่ตรงนี้) ทางลัดนี้ดูเวิร์กสุด ๆ แล้วจอแชทก็หายไป
พอถึงเฟส test ที่ต้องทำเดี่ยว ไม่มีตัวช่วยอีกแล้ว ตัวเลขก็กลับด้านทันที
ในการทดลองแรก กลุ่มที่เพิ่งพึ่ง AI ทำโจทย์เดี่ยวได้แค่ 57% ส่วนกลุ่มที่ไม่เคยมี AI ให้พึ่งทำได้ 73% คนที่ "ดูเหมือนเก่งกว่า" ตอนมีตัวช่วย กลับกลายเป็นคนที่ร่วงแรงกว่าเมื่อตัวช่วยหายไป และที่เข้ากับความรู้สึกในตอนต้นบทความเป๊ะ ๆ คือกลุ่ม AI ยังกดข้ามบ่อยเกือบสองเท่า (20% เทียบ 11%) เหมือนความอึดถูกดูดหายไปพร้อมกับแชท
"10 นาที" ที่คนแชร์กันมาจากตรงนี้ครับ เฟส learning ยาวแค่ราว 10–15 นาที ก็เห็นผลต่างชัดเจนขนาดนี้แล้ว ไม่ต้องใช้ AI เป็นเดือนเป็นปี
แต่เดี๋ยวก่อน ตัวเลข 57 เทียบ 73 นี้เชื่อได้แค่ไหน? ทีมวิจัยเองก็ตั้งคำถามเดียวกัน พอไปรื้อดูก็เจอ "รูรั่ว" ในการทดลองแรก: เกณฑ์คัดคนออกเผลอตัดคนที่ทำคะแนนต่ำออกจากกลุ่มควบคุมมากกว่ากลุ่ม AI เพราะคนอ่อนในกลุ่ม AI แค่ก๊อปคำตอบที่ AI ให้มาก็ "ผ่าน" เกณฑ์เข้ามาได้ง่ายกว่า ส่วนกลุ่มควบคุมไม่มีตัวช่วยแบบนั้น ช่องว่างที่เห็นในรอบแรกจึงอาจถูกขยายเกินจริง
แทนที่จะปล่อยผ่าน ทีมวิจัยลงมือ "ฆ่าผลตัวเอง" ด้วยการทำการทดลองที่ 2 อุดรูรั่วนั้น พร้อมเพิ่มแบบทดสอบ pretest วัดพื้นฐานแต่ละคนก่อนเริ่ม เพื่อเทียบให้แม่นขึ้น แล้วยังทำการทดลองที่ 3 ต่ออีก คราวนี้เปลี่ยนจากเศษส่วนไปเป็นโจทย์อ่านจับใจความสไตล์ SAT เพื่อเช็คว่าปรากฏการณ์นี้เป็นเรื่องของ "เลข" อย่างเดียว หรือลามไปถึงทักษะภาษาด้วย
ผลคือ... รูรั่วถูกอุดแล้ว แต่แพตเทิร์นยังอยู่ที่เดิม การทดลองที่ 2 ช่องว่างแคบลง (71% เทียบ 77%) แต่ไม่หาย ส่วนการทดลองที่ 3 กับโจทย์ภาษา ช่องว่างกลับกว้างขึ้นอีก (76% เทียบ 89%) และกดข้าม 8% เทียบ 1% การทำซ้ำที่ตั้งใจจะหักล้างผลตัวเอง กลับกลายเป็นหลักฐานที่หนักแน่นกว่าเดิมว่านี่ไม่ใช่ฟลุคของโจทย์ประเภทเดียว
ช่องว่างของอัตราตอบถูกมีนัยสำคัญทางสถิติทั้ง 3 การทดลอง ส่วนอัตรากดข้ามมีนัยสำคัญใน 2 การทดลอง ยกเว้นการทดลองที่ 2 ที่ต่างกันไม่ชัดพอ
แต่ตัวเลขพวกนี้ยังไม่ใช่ตัวที่น่ากลัวที่สุด ตัวจริงซ่อนอยู่ในคำถามที่ทีมวิจัยถามกลุ่ม AI หลังสอบเสร็จ
ในการทดลองที่ 2 ทีมวิจัยถามผู้เข้าร่วมกลุ่ม AI ทุกคนว่า "ระหว่างช่วง learning คุณใช้ AI ยังไง" ลองตอบตัวเองก่อนเฉลยครับ: ถ้ามีแชท AI อยู่ข้างจอกับโจทย์เศษส่วนตรงหน้า คุณจะพิมพ์ขออะไร ระหว่างคำตอบเลย หรือ คำใบ้?
คำตอบแบ่งเป็น 3 กลุ่ม: 61% ขอคำตอบตรง ๆ, 27% ขอคำใบ้ (hint), และ 12% แทบไม่ใช้เลย แล้วพอเอาผลสอบ (ตอนไม่มี AI แล้ว) มาแยกตามท่าใช้ ตัวเลขเรียงตามท่าเป๊ะ คือ 0.65 / 0.76 / 0.89 ตามลำดับ (กลุ่มควบคุมอยู่ที่ 0.77 ใกล้เคียงกลุ่มขอคำใบ้)
อ่านให้ดีครับ คนที่ไม่แตะ AI เลยระหว่าง learning กลับสอบได้ดีที่สุด (0.89) ดีกว่ากลุ่มควบคุมที่ 0.77 ด้วยซ้ำ ส่วนคนที่ขอคำตอบตรง ๆ คือกลุ่มเดียวที่คะแนนร่วงจริงจากช่วง pretest (−0.10 เทียบกับกลุ่มควบคุมที่ +0.01)
ไม่มีใครบังคับ 61% เลือกท่าที่เป็นพิษกับตัวเองที่สุดด้วยตัวเอง
ต้องออกตัวไว้นิดนึง: ตัวเลขแยกตามท่าใช้นี้เป็นการเทียบกลุ่มที่คน "เลือกท่าเอง" ไม่ได้สุ่มแบ่ง เลยยังฟันธงเหตุ-ผลตรง ๆ ไม่ได้ 100% (รายละเอียดข้อจำกัดอยู่ท้ายบทความ) แต่ตัวเลขที่เรียงเป็นบันไดเป๊ะขนาดนี้ก็หนักแน่นพอให้เชื่อได้ระดับหนึ่ง และ 61% นั้น อาจรวมคุณกับผมอยู่ด้วย
แล้วทำไมแค่ 10–15 นาทีถึงเปลี่ยนคนได้ขนาดนั้น? เปเปอร์เสนอกลไก 2 ตัวที่อธิบายว่าความช่วยเหลือที่เร็วและง่ายกัดกร่อนความอึดของเราได้ภายในไม่กี่นาทียังไง
ตัวแรกคือ hedonic adaptation ลองนึกภาพคนที่ขึ้นลิฟต์ทุกวัน จนวันหนึ่งลิฟต์เสีย ต้องเดินขึ้นบันไดแค่ 3 ชั้น กลับรู้สึกเหนื่อยเกินจริง ทั้งที่ 3 ชั้นก็แค่ 3 ชั้นเท่าเดิม สิ่งที่เปลี่ยนไม่ใช่ระยะทาง แต่คือ "จุดอ้างอิง" ในหัวว่างานแบบนี้ควรใช้แรง/เวลาเท่าไหร่ พอ AI ตอบให้ในไม่กี่วินาทีซ้ำ ๆ จุดอ้างอิงนั้นก็ขยับตาม แล้วงานเดี่ยวที่ยากเท่าเดิมก็เริ่ม "รู้สึก" หนักขึ้น ทั้งที่โจทย์ไม่ได้เปลี่ยน
ตัวที่สองคือ metacognitive calibration เปเปอร์อธิบายว่า AI ตัดตอน "การดิ้นรนที่มีประโยชน์" (productive struggle) ที่คนใช้เรียนรู้ขีดความสามารถจริงของตัวเอง พอไม่เคยได้ลุยเองบ่อย ๆ ก็ไม่มีข้อมูลมาปรับเข็มว่า "จริง ๆ แล้วฉันไหวแค่ไหน" ยิ่งไม่รู้ ยิ่งประเมินตัวเองต่ำเกินจริง แล้วก็ยิ่งยอมแพ้เร็วเมื่อเจอโจทย์ยาก
แกะคำศัพท์
Hedonic adaptation อ่านว่า "ฮีโดนิก อะแดปเทชัน" (รากศัพท์กรีก hedone = ความพึงใจ) แปลว่า "ความเคยชินที่ทำให้จุดอ้างอิงความสุข/ความง่ายขยับ" เป็นแนวคิดคลาสสิกในจิตวิทยา ที่นี่เอามาอธิบายว่าทำไมความช่วยเหลือที่เร็วเกินไป ถึงทำให้ความเร็วปกติกลายเป็น "ช้า" ในความรู้สึก
Metacognition อ่านว่า "เมตาคอกนิชัน" แปลว่า "การรู้ว่าตัวเองรู้/ไหวแค่ไหน" ส่วน calibration อ่านว่า "แคลิเบรชัน" แปลว่า "การตั้งเข็มให้ตรง" รวมกันคือความสามารถประเมินขีดความสามารถของตัวเองได้แม่นยำ (กลับด้านกับ Dunning-Kruger effect ที่บทความ เลือกโมเดล + วางระบบความจำ เคยเล่า โดยอันนั้นคือคน "มั่นใจเกินจริง" ทั้งที่ไม่เก่ง ส่วนที่นี่คือคน "มั่นใจน้อยเกินจริง" เพราะไม่เคยได้วัดฝีมือตัวเองเลย)
เกร็ดเล็ก ๆ: หนึ่งในทีมวิจัยคือ Brian Christian (ไบรอัน คริสเตียน) คนเขียนหนังสือขายดี The Alignment Problem และ Algorithms to Live By ปัจจุบันทำวิจัยด้าน human-AI interaction อยู่ที่ Oxford ไม่แปลกที่กลไกที่ทีมเสนอจะคมแบบนี้
ความซื่อสัตย์ทางปัญญาสำคัญพอ ๆ กับตัวเลขที่น่าตกใจ ก่อนจะเชื่อสุดตัว มาดูว่าเปเปอร์นี้ตอบอะไรไม่ได้บ้าง
บทความ ถ้า AI เก่งขนาดนี้ แล้วเราจะอยู่ไปทำไม เคยบอกว่าคุณค่าของคนกำลังย้ายไปอยู่ที่ "การตัดสิน" (taste) งานวิจัยชิ้นนี้คือคำเตือนด้านกลับของเหรียญเดียวกัน ถ้าใช้ AI แบบเสกคำตอบมาให้ตัวเองล้วน ๆ สิ่งที่หดลงไม่ใช่แค่ทักษะการคำนวณหรือการอ่าน แต่คือ "ความอึด" ที่การตัดสินใจดี ๆ ทุกครั้งต้องใช้เป็นวัตถุดิบ เพราะการฝึกตัดสินก็ต้องอาศัยความมานะกัดโจทย์ยากด้วยตัวเองก่อนเหมือนกัน
💡 ลองปรับ 3 อย่างครั้งหน้าที่จะเปิดแชท AI
1. ขอ "คำใบ้" ก่อน "คำตอบ": ตัวเลข 0.76 เทียบ 0.65 ในการทดลองที่ 2 คือหลักฐานว่าแค่เปลี่ยนคำถามที่พิมพ์ ผลตอนไม่มี AI ให้พึ่งก็ต่างกันชัดแล้ว
2. ลองเองสัก 2–3 นาทีก่อนเปิดแชท: เก็บ "การดิ้นรนที่มีประโยชน์" ไว้ให้ตัวเองบ้าง
3. ให้ AI "ตรวจ" แทนที่จะให้มัน "ทำ": พลิกจากคนขอคำตอบ เป็นคนที่ตัดสินคำตอบ
ครั้งหน้าที่รู้สึกหงุดหงิดเร็วผิดปกติตอน AI ช่วยไม่ได้ นั่นไม่ใช่สัญญาณว่าคุณขี้เกียจลงครับ มันคือจุดอ้างอิงในหัวที่ขยับไป และข่าวดีคือมันดึงกลับมาได้ ถ้าเรายอมกัดโจทย์ยากด้วยตัวเองบ้างเป็นครั้งคราว
AI ไม่ได้ขโมยความสามารถของคุณ มันแค่ทำให้คุณเลิกไปรับความสามารถนั้นมาเอง
เรียบเรียงและอธิบายใหม่ด้วยคำตัวเอง โดยตรวจสอบข้อเท็จจริงกับแหล่งปฐมภูมิด้านล่าง