Claude Code

ทำให้ Claude ดูวิดีโอเป็น ด้วย /watch (แถมให้มันตัดต่อด้วย)

Claude เปิดโปรเจกต์ อ่านโค้ด รันสคริปต์ ค้นเว็บได้หมด แต่มีงานนึงที่มันทำไม่ได้มาตลอด คือ "ดูวิดีโอ" มาดูปลั๊กอินตัวเดียวที่ทำให้มันดูคลิปจริง เห็นทั้งภาพและเสียง แล้วต่อยอดไปถึงให้มันลงมือตัดต่อแทนเรา

ลองนึกภาพ คุณเจอคลิปยูทูบสอนตั้งค่าอะไรสักอย่างยาว 40 นาที ขี้เกียจนั่งดูเอง เลยวางลิงก์ให้ Claude แล้วสั่งว่า "สรุปให้หน่อยว่าคลิปนี้บอกให้ตั้งค่าอะไรบ้าง" คำตอบที่ได้ฟังดูเข้าท่ามาก… จนคุณเปิดดูจริงแล้วพบว่ามันมั่วครึ่งนึง

ที่เป็นแบบนี้เพราะมันไม่เคยเห็นคลิปนั้นเลยแม้แต่เฟรมเดียว สิ่งที่มันทำได้จริงคือเดาเนื้อหาจากชื่อคลิป ไม่ก็ไปดึงคำบรรยาย (caption) มาอ่าน ซึ่งมีแค่ "บทพูด" ไม่ได้บอกว่าบนจอกำลังเกิดอะไรขึ้น คลิปที่คนพิมพ์โค้ดโชว์เงียบ ๆ ไม่พูดสักคำ มันก็จบเห่ เพราะไม่มีเสียงให้อ่าน และมันก็มองจอไม่เห็นอยู่ดี


/watch: คำสั่งเดียวที่ทำให้มัน "เห็น" จริง

มีปลั๊กอินโอเพนซอร์สชื่อ claude-video ที่เพิ่มคำสั่ง /watch (อ่านว่า "ว็อตช์" แปลตรง ๆ ว่า "ดู/เฝ้าดู" ชื่อคำสั่งบอกสิ่งที่มันทำเป๊ะ ๆ) เข้ามาแก้ข้อจำกัดนี้พอดี ตัวมันดังเปรี้ยงในเดือนกรกฎาคม 2026 ขึ้นอันดับ 1 GitHub Trending และมีคนกดดาวไปหลายพันในเวลาไม่กี่วัน

วิธีใช้ตรงไปตรงมา พิมพ์ /watch ตามด้วยลิงก์หรือไฟล์วิดีโอ แล้วต่อด้วยคำถามที่อยากรู้:

รูปแบบการเรียกใช้ /watch
/watch <ลิงก์หรือไฟล์วิดีโอ> <คำถามที่อยากรู้>

# ดูคลิปยูทูบแล้วถามเจาะจุด
/watch https://youtu.be/xxxxxxxx สรุปหัวข้อสำคัญให้หน่อย

# ดูไฟล์ในเครื่อง เจาะเฉพาะช่วง 2:15–2:45
/watch ~/clip.mp4 --start 2:15 --end 2:45 ตรงนี้โปรแกรมมันพังเพราะอะไร

คราวนี้มันดูคลิปนั้นจริง ๆ เห็นทั้งภาพบนจอและรู้ว่าในคลิปพูดอะไร แล้วค่อยตอบจากสิ่งที่เห็นและได้ยิน ไม่ใช่เดาจากชื่อไฟล์อีกต่อไป


เบื้องหลัง: มันไม่ได้เปิดดูทั้งคลิป

ตรงนี้คือจุดที่คนเข้าใจผิดกันเยอะ พอบอกว่า "Claude ดูคลิปได้แล้ว" เรามักนึกว่ามันนั่งดูเฟรมต่อเฟรมเหมือนเรากดเพลย์ ความจริงมันทำแบบนั้นไม่ได้ และไม่ควรทำด้วย เพราะคลิปสั้น ๆ คลิปเดียวมีเป็นหมื่นเฟรม

แกะคำศัพท์

frame (อ่านว่า "เฟรม" แปลว่า "ภาพนิ่งหนึ่งภาพ") คือภาพนิ่งหนึ่งใบในวิดีโอ คลิปคือเฟรมนิ่งหลายพันใบเรียงต่อกันแล้วฉายเร็ว ๆ (ปกติ 24–30 เฟรมต่อวินาที) จนตาเราเห็นเป็นภาพเคลื่อนไหว คลิป 40 นาทีจึงมีราว 60,000 เฟรม ถ้าเก็บหมดแล้วส่งให้ Claude ก็ได้ภาพซ้ำ ๆ กันเป็นร้อยเป็นพัน เปลืองเปล่า ๆ

มันเลยไม่ดึงทุกเฟรม แต่เลือกเฉพาะเฟรมช่วงที่ภาพเปลี่ยนจริง เช่น ตอนสไลด์เปลี่ยน มุมกล้องเปลี่ยน หรือมีข้อความใหม่ขึ้นจอ เทคนิคนี้เรียกว่า scene-change detection ("ซีนเชนจ์" = ตรวจจับจังหวะที่ภาพเปลี่ยนฉาก) ถ้าสองเฟรมติดกันหน้าตาแทบเหมือนกัน มันก็ทิ้งใบซ้ำไป เก็บไว้แค่ใบที่ "ต่างจริง" เหมือนเราเปิดหนังสือดูสารบัญแทนการอ่านทุกหน้า ได้ใจความครบโดยไม่ต้องกวาดทุกบรรทัด

ส่วน "เสียง" ในคลิป มันดึงคำบรรยาย (caption) ที่ติดมากับคลิปมาก่อนถ้ามี ซึ่งฟรีและเร็ว ถ้าคลิปไหนไม่มี caption มันถึงจะถอดเสียงเองด้วย Whisper ("วิสเปอร์" แปลว่า "กระซิบ" เป็นโมเดลถอดเสียงเป็นข้อความ) ได้ออกมาเป็น transcript ("ทรานสคริปต์" = บทพูดที่ถอดเป็นข้อความ) พร้อมกำกับไว้ด้วยว่านาทีไหนพูดอะไร สุดท้ายมันส่งทั้งภาพและบทพูดให้ Claude อ่านพร้อมกัน โมเดลเลยตอบจากสิ่งที่เห็นและได้ยินจริง

คลิปเต็ม ~60,000 เฟรม ส่วนใหญ่หน้าตาซ้ำกัน กรอง scene-change detection ตัดเฟรมซ้ำทิ้ง เก็บเฉพาะที่ภาพเปลี่ยน เหลือ ~50 เฟรมที่ต่างจริง + transcript ถอดเสียง 0:00 · 0:42 · 1:37 … (กำกับนาทีที่พูด) Claude อ่านภาพ + บทพูด
หมื่นเฟรมเหลือห้าสิบ · Claude ไม่ได้ดูทุกเฟรม มันดูเฉพาะจังหวะที่ภาพเปลี่ยนบวกกับบทพูด ก็พอเข้าใจทั้งคลิป

มีปุ่มปรับ "ประหยัด ↔ ละเอียด"

claude-video ให้เลือก "โหมด" ความละเอียดได้ด้วย --detail ตั้งแต่ถอดแต่บทพูดล้วน ไปจนถึงกวาดภาพแบบไม่จำกัด ยิ่งละเอียดยิ่งเก็บภาพเยอะ (และแพงขึ้น) ค่าตัวเลขด้านล่างเป็นค่าที่ผู้พัฒนารายงานไว้ใน README:

โหมด (--detail)เก็บภาพจากเพดานเฟรมเวลาดึง
transcriptบทพูดอย่างเดียว0 ภาพ~4.5 วิ
efficientkeyframe50~0.5 วิ
balancedscene-change100~21 วิ
token-burnerscene-changeไม่จำกัด~21 วิ

(keyframe = "คีย์เฟรม" คือเฟรมสำคัญที่เป็นตัวแทนช่วงนั้น ๆ วิธีนี้เร็วเพราะไม่ต้องไล่เทียบทุกเฟรม ส่วน scene-change ช้ากว่าเพราะต้องเดินดูทั้งคลิปเพื่อจับจังหวะที่ภาพเปลี่ยน แต่ได้ภาพที่ตรงจุดกว่า)


พอมันดูคลิปเป็น งานที่เคยต้องนั่งดูเองก็โยนให้มันได้

เมื่อ Claude เห็นภาพในคลิปจริง ๆ งานหลายอย่างที่แต่ก่อนต้องเสียเวลานั่งเปิดดูเองก็ส่งต่อให้มันทำแทนได้:

  • แกะฮุกคลิปไวรัล: อยากรู้ว่าคลิปที่คนแชร์กันเปิดเรื่องด้วยฮุก (hook = ช่วงเปิดคลิปที่ตรึงคนไม่ให้เลื่อนผ่าน) แบบไหน สั่งให้มันไล่ดูช่วงต้นคลิป แล้ววิเคราะห์ว่าเขาวางโครงเล่าเรื่องยังไง
  • สรุปคลิปยาวที่ไม่มีเวลาดู: คลิปชั่วโมงนึง สั่งให้สรุปหัวข้อสำคัญ ได้ใจความเร็วกว่านั่งดูเองแบบเร่งความเร็วสองเท่า
  • ตัดคำโฆษณาออก: คลิปเปิดตัวฟีเจอร์ใหม่ที่โม้ว่าเปลี่ยนโลก สั่งให้ไล่ดูทั้งคลิปแล้วสรุปว่ามีอะไรใหม่จริงบ้าง โดยตัดคำขายของทิ้ง
  • หาจุดที่โปรแกรมพัง: คลิปอัดหน้าจอตอนโปรแกรมเจ๊ง ถามว่ามันพังตรงไหน มันจะไล่ดูจนเจอเฟรมที่เริ่มมีปัญหา บ่อยครั้งเจอต้นเหตุตั้งแต่ยังไม่ทันเปิดไฟล์โค้ดดูด้วยซ้ำ

และมันไม่ได้ดูแค่ยูทูบ เบื้องหลังใช้เครื่องมือชื่อ yt-dlp ("วายที-ดีแอลพี" โปรแกรมดาวน์โหลดวิดีโอ) ที่รองรับแหล่งวิดีโอเป็นร้อยเว็บ ทั้ง TikTok, Instagram, X รวมถึงไฟล์วิดีโอในเครื่องเอง (.mp4, .mov, .mkv, .webm) ครีเอเตอร์เลยเอาไปแกะโครงคลิป TikTok ของคู่แข่งได้ตรง ๆ ว่าเขาวางจังหวะเล่าเรื่องยังไง คลิปไหนยอดวิวพุ่งก็ดูได้เลยว่าส่วนไหนทำได้ดี โดยไม่ต้องมานั่งเปิดดูเองซ้ำสิบรอบ


เรื่องต้องรู้ก่อนลอง: ค่าใช้จ่ายคิดตาม "จำนวนภาพ" ไม่ใช่ความยาวคลิป

นี่คือจุดที่เซอร์ไพรส์คนส่วนใหญ่ คือต้นทุนของ /watch ไม่ได้ขึ้นกับว่าคลิปยาวกี่นาที แต่ขึ้นกับว่ามันดึงมากี่เฟรม เพราะทุกเฟรมที่ส่งให้ Claude นับเป็น "หนึ่งรูป" และรูปกินโทเคนตามพื้นที่ภาพ (สูตรของ Anthropic คือ กว้าง × สูง ÷ 750 ที่ความละเอียดเริ่มต้น 512px เฟรมหนึ่งตกราว 197 โทเคน) ดึงเฟรมมาเยอะ ค่าใช้จ่ายก็สูงตาม

ผลที่ตามมาแบบทวนสัญชาตญาณคือ คลิปนิ่ง ๆ ยาว 49 นาทีอาจถูกกว่าคลิปหวือหวา 3 นาที เพราะคลิปอัดหน้าจอนิ่ง ๆ ภาพแทบไม่เปลี่ยน scene-change เลยคัดมาแค่ ~50 ภาพก็ครอบคลุมตั้งแต่ต้นจนจบ ส่วนคลิปตัดต่อรัว ๆ ภาพเปลี่ยนทุกวินาที กลับดึงเฟรมมาเพียบ

เคล็ดลับประหยัด

ถ้าคลิปยาวแต่คุณสนใจแค่บางช่วง ใส่ --start กับ --end บอกให้มันดูเฉพาะช่วงเวลาที่กำหนด ประหยัดทั้งเวลาและเงิน หรือจะลดเพดานเฟรมด้วย --max-frames ก็ได้ และถ้าอยากได้แค่บทพูดไม่เอาภาพเลย ก็ --detail transcript


ติดตั้ง: สองบรรทัดก็เสร็จ

ติดตั้งไม่ยากอย่างที่กลัว บน Claude Code (โปรแกรมที่ใช้พิมพ์สั่งงาน Claude บนเครื่องเรา) แค่เพิ่ม marketplace แล้ว install พิมพ์สองบรรทัดนี้ในแชท (ส่งทีละบรรทัด):

ติดตั้งบน Claude Code (พิมพ์ในแชท)
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

เครื่องมือ AI สายโค้ดตัวอื่นอย่าง Codex, Cursor, Gemini CLI (และอีก 50+ ตัว) ก็ลงได้ด้วยคำสั่งเดียวใน terminal ครั้งแรกที่ใช้ มันจะติดตั้ง yt-dlp กับ ffmpeg ให้อัตโนมัติ (Whisper จะใช้ก็ต่อเมื่อคลิปไม่มี caption เท่านั้น):

ติดตั้งบน agent อื่น (รันใน terminal)
npx skills add bradautomates/claude-video -g

ระวังก่อนติดตั้ง

ปลั๊กอินจากภายนอกก็เหมือนโค้ดจากภายนอก ควรเปิดไฟล์ SKILL.md ของมันดูสักนิดว่ามันสั่งให้ Claude ทำอะไรบ้างก่อนติดตั้ง โดยเฉพาะตัวที่ต้องดาวน์โหลดไฟล์จากเน็ตและรันคำสั่งในเครื่องเราแบบนี้


ต่อยอด: /watch ให้มัน "ดูเป็น" แต่ Claude ยัง "ตัดต่อเป็น" ด้วย

/watch เก่งเรื่องให้ Claude อ่านวิดีโอ (เอาคลิปเข้ามาเป็นข้อมูล) แต่ถ้าถามว่า Claude ช่วยงานตัดต่อวิดีโอได้ไหม คำตอบคือได้ และมันเป็นคนละทิศทางกันพอดี อันหนึ่งคือ "ดูเข้ามา" อีกอันคือ "สร้างออกไป"

หัวใจที่ต้องเข้าใจก่อนคือ Claude ไม่ได้ลากไทม์ไลน์ตัดต่อไฟล์เอง มันทำตัวเป็น "คนคุมวง" ที่เขียนและสั่งรันคำสั่งของโปรแกรมชื่อ FFmpeg ให้ต่างหาก

แกะคำศัพท์

FFmpeg (อ่านว่า "เอฟเอฟ-เอ็มเพ็ก" ย่อจาก Fast Forward MPEG) คือโปรแกรมสายคอมมานด์ไลน์ที่เป็นเหมือน "มีดพับสวิสของงานวิดีโอ": ตัดคลิป รวมคลิป ย่อขนาด บีบไฟล์ แปลงฟอร์แมต ใส่ซับ เร่ง/หน่วงความเร็ว ทำได้เกือบหมดด้วยคำสั่งบรรทัดเดียว เครื่องมือตัดต่อดัง ๆ เบื้องหลังหลายตัวก็เรียกใช้ FFmpeg นี่แหละ ปัญหาเดียวคือคำสั่งมันจำยากและพารามิเตอร์เยอะมาก ซึ่งเป็นงานที่ Claude ถนัด

พูดง่าย ๆ คือเราคุยกับ Claude เป็นภาษาคน ("ตัดเอาช่วง 30 วินาทีแรกออก แล้วย่อความละเอียดเหลือ 720p") แล้วมันแปลงเป็นคำสั่ง FFmpeg ที่ถูกต้องให้ พร้อมรันให้เลย เราไม่ต้องไปจำว่า -ss, -vf scale, -c:v คืออะไร มุมมองที่คนใช้จริงสรุปตรงกันคือ:

คุณค่าของ AI กับงานวิดีโอไม่ได้อยู่ที่การ "เจน" คลิปทั้งอันขึ้นมาใหม่ แต่อยู่ที่การ "บีบอัดและจัดโครง" ฟุตเทจจริงที่เรามีอยู่แล้ว

ไปป์ไลน์ที่คนทำจริงมักวางแบบนี้: Claude ช่วยแปลงสคริปต์หรือไอเดียเป็นรายการช็อต (shot list) และไทม์ไลน์คร่าว ๆ → เขียนคำสั่ง FFmpeg ไล่ตัด-รวม-ย่อ-บีบไฟล์เป็นชุด (batch) → แล้วสั่งรันเรนเดอร์ออกมาเป็นไฟล์สุดท้าย งานซ้ำ ๆ อย่างตัดหัวท้ายคลิปทั้งโฟลเดอร์ หรือแปลงฟอร์แมตหลายสิบไฟล์ให้เหมือนกัน กลายเป็นสั่งทีเดียวจบ

Claude ทั้งอ่านและสร้าง วิดีโอ (ขาเข้า) ยูทูบ · TikTok · ไฟล์ /watch เฟรม + transcript คำสั่ง FFmpeg ตัด · รวม · เรนเดอร์ วิดีโอใหม่ (ขาออก) ตัดต่อเสร็จแล้ว
/watch ให้ Claude "ตา" ไว้ดู ส่วน FFmpeg ให้มัน "มือ" ไว้ตัด · อ่านกับสร้าง คนละทิศแต่ต่อกันเป็นวงเดียว

จุดที่สวยที่สุดคือตอนสองฝั่งนี้มาบรรจบกัน: ใช้ /watch ดูคลิปคู่แข่งหรือฟุตเทจดิบเพื่อเข้าใจว่าอะไรเวิร์ก แล้วสั่ง Claude ให้ใช้ FFmpeg ลงมือตัดคลิปของเราตามนั้น ครบวงจร "ดู → คิด → ตัด" ในเครื่องมือเดียว

และ FFmpeg เป็นแค่ประตูบานแรกของฝั่ง "ตัดต่อ" Claude ยังคุมโปรแกรมตัดต่อจริงอย่าง CapCut หรือ Premiere Pro ได้ด้วย ซึ่งลงลึกกว่านี้มาก บทความถัดไปพาไปติดตั้งและลองทีละเส้นทาง พร้อมข้อควรระวังที่ต้องรู้ก่อนเปิดประตูให้มัน


สรุปบรรทัดเดียว

เมื่อก่อน Claude ได้แค่เดาเนื้อหาจากชื่อคลิป วันนี้มันดูเป็น (ผ่าน /watch ที่คัดเฉพาะเฟรมสำคัญบวกบทพูด) และตัดต่อเป็น (ผ่านการคุม FFmpeg) วิดีโอเลิกเป็นกล่องดำสำหรับ AI ไปแล้ว

ครั้งหน้าที่เจอคลิปที่อยากรู้ว่าข้างในมีอะไร ลองใช้ /watch ให้มันดูสักคลิป ถามหนึ่งคำถามที่อยากรู้ แล้วเทียบกับตอนที่มันได้แค่เดาจากชื่อคลิป คุณจะเห็นเองว่าคำตอบมันต่างกันแค่ไหน

แหล่งอ้างอิง

เรียบเรียงและอธิบายใหม่ด้วยคำตัวเอง โดยตรวจสอบข้อเท็จจริงกับแหล่งปฐมภูมิด้านล่าง (ค่าตัวเลขเฟรม/เวลา/โทเคนเป็นค่าที่ผู้พัฒนารายงานไว้ใน README ณ วันสืบค้น อาจเปลี่ยนได้ตามเวอร์ชัน)

  1. "claude-video: /watch downloads, extracts frames, transcribes, hands it all to Claude (README: detail modes, flags, token formula, install)" · Brad Bonanno, GitHub, สืบค้นเมื่อ 22 กรกฎาคม 2026
  2. "/watch ทำให้ Claude ดูวิดีโอได้: เห็นภาพบนจอและได้ยินเสียง ไม่ได้เดาจากชื่อคลิป" · Vibe Coding Thailand, สืบค้นเมื่อ 22 กรกฎาคม 2026
  3. "Claude Code + video editing: Claude เป็น orchestration layer เขียน/รันคำสั่ง FFmpeg (ingest, trim, render)" · Clixie AI, สืบค้นเมื่อ 22 กรกฎาคม 2026
  4. "Claude for video editing in 2026: the real pipeline (the value is compression, not generation)" · Cutback / Selects, สืบค้นเมื่อ 22 กรกฎาคม 2026
  5. "About FFmpeg: เครื่องมือ command-line สำหรับ record/convert/stream วิดีโอและเสียง" · FFmpeg, สืบค้นเมื่อ 22 กรกฎาคม 2026