/watch (แถมให้มันตัดต่อด้วย)Claude เปิดโปรเจกต์ อ่านโค้ด รันสคริปต์ ค้นเว็บได้หมด แต่มีงานนึงที่มันทำไม่ได้มาตลอด คือ "ดูวิดีโอ" มาดูปลั๊กอินตัวเดียวที่ทำให้มันดูคลิปจริง เห็นทั้งภาพและเสียง แล้วต่อยอดไปถึงให้มันลงมือตัดต่อแทนเรา
ลองนึกภาพ คุณเจอคลิปยูทูบสอนตั้งค่าอะไรสักอย่างยาว 40 นาที ขี้เกียจนั่งดูเอง เลยวางลิงก์ให้ Claude แล้วสั่งว่า "สรุปให้หน่อยว่าคลิปนี้บอกให้ตั้งค่าอะไรบ้าง" คำตอบที่ได้ฟังดูเข้าท่ามาก… จนคุณเปิดดูจริงแล้วพบว่ามันมั่วครึ่งนึง
ที่เป็นแบบนี้เพราะมันไม่เคยเห็นคลิปนั้นเลยแม้แต่เฟรมเดียว สิ่งที่มันทำได้จริงคือเดาเนื้อหาจากชื่อคลิป ไม่ก็ไปดึงคำบรรยาย (caption) มาอ่าน ซึ่งมีแค่ "บทพูด" ไม่ได้บอกว่าบนจอกำลังเกิดอะไรขึ้น คลิปที่คนพิมพ์โค้ดโชว์เงียบ ๆ ไม่พูดสักคำ มันก็จบเห่ เพราะไม่มีเสียงให้อ่าน และมันก็มองจอไม่เห็นอยู่ดี
มีปลั๊กอินโอเพนซอร์สชื่อ claude-video ที่เพิ่มคำสั่ง /watch
(อ่านว่า "ว็อตช์" แปลตรง ๆ ว่า "ดู/เฝ้าดู" ชื่อคำสั่งบอกสิ่งที่มันทำเป๊ะ ๆ) เข้ามาแก้ข้อจำกัดนี้พอดี
ตัวมันดังเปรี้ยงในเดือนกรกฎาคม 2026 ขึ้นอันดับ 1 GitHub Trending และมีคนกดดาวไปหลายพันในเวลาไม่กี่วัน
วิธีใช้ตรงไปตรงมา พิมพ์ /watch ตามด้วยลิงก์หรือไฟล์วิดีโอ แล้วต่อด้วยคำถามที่อยากรู้:
/watch <ลิงก์หรือไฟล์วิดีโอ> <คำถามที่อยากรู้>
# ดูคลิปยูทูบแล้วถามเจาะจุด
/watch https://youtu.be/xxxxxxxx สรุปหัวข้อสำคัญให้หน่อย
# ดูไฟล์ในเครื่อง เจาะเฉพาะช่วง 2:15–2:45
/watch ~/clip.mp4 --start 2:15 --end 2:45 ตรงนี้โปรแกรมมันพังเพราะอะไร คราวนี้มันดูคลิปนั้นจริง ๆ เห็นทั้งภาพบนจอและรู้ว่าในคลิปพูดอะไร แล้วค่อยตอบจากสิ่งที่เห็นและได้ยิน ไม่ใช่เดาจากชื่อไฟล์อีกต่อไป
ตรงนี้คือจุดที่คนเข้าใจผิดกันเยอะ พอบอกว่า "Claude ดูคลิปได้แล้ว" เรามักนึกว่ามันนั่งดูเฟรมต่อเฟรมเหมือนเรากดเพลย์ ความจริงมันทำแบบนั้นไม่ได้ และไม่ควรทำด้วย เพราะคลิปสั้น ๆ คลิปเดียวมีเป็นหมื่นเฟรม
แกะคำศัพท์
frame (อ่านว่า "เฟรม" แปลว่า "ภาพนิ่งหนึ่งภาพ") คือภาพนิ่งหนึ่งใบในวิดีโอ คลิปคือเฟรมนิ่งหลายพันใบเรียงต่อกันแล้วฉายเร็ว ๆ (ปกติ 24–30 เฟรมต่อวินาที) จนตาเราเห็นเป็นภาพเคลื่อนไหว คลิป 40 นาทีจึงมีราว 60,000 เฟรม ถ้าเก็บหมดแล้วส่งให้ Claude ก็ได้ภาพซ้ำ ๆ กันเป็นร้อยเป็นพัน เปลืองเปล่า ๆ
มันเลยไม่ดึงทุกเฟรม แต่เลือกเฉพาะเฟรมช่วงที่ภาพเปลี่ยนจริง เช่น ตอนสไลด์เปลี่ยน มุมกล้องเปลี่ยน หรือมีข้อความใหม่ขึ้นจอ เทคนิคนี้เรียกว่า scene-change detection ("ซีนเชนจ์" = ตรวจจับจังหวะที่ภาพเปลี่ยนฉาก) ถ้าสองเฟรมติดกันหน้าตาแทบเหมือนกัน มันก็ทิ้งใบซ้ำไป เก็บไว้แค่ใบที่ "ต่างจริง" เหมือนเราเปิดหนังสือดูสารบัญแทนการอ่านทุกหน้า ได้ใจความครบโดยไม่ต้องกวาดทุกบรรทัด
ส่วน "เสียง" ในคลิป มันดึงคำบรรยาย (caption) ที่ติดมากับคลิปมาก่อนถ้ามี ซึ่งฟรีและเร็ว ถ้าคลิปไหนไม่มี caption มันถึงจะถอดเสียงเองด้วย Whisper ("วิสเปอร์" แปลว่า "กระซิบ" เป็นโมเดลถอดเสียงเป็นข้อความ) ได้ออกมาเป็น transcript ("ทรานสคริปต์" = บทพูดที่ถอดเป็นข้อความ) พร้อมกำกับไว้ด้วยว่านาทีไหนพูดอะไร สุดท้ายมันส่งทั้งภาพและบทพูดให้ Claude อ่านพร้อมกัน โมเดลเลยตอบจากสิ่งที่เห็นและได้ยินจริง
มีปุ่มปรับ "ประหยัด ↔ ละเอียด"
claude-video ให้เลือก "โหมด" ความละเอียดได้ด้วย --detail ตั้งแต่ถอดแต่บทพูดล้วน ไปจนถึงกวาดภาพแบบไม่จำกัด
ยิ่งละเอียดยิ่งเก็บภาพเยอะ (และแพงขึ้น) ค่าตัวเลขด้านล่างเป็นค่าที่ผู้พัฒนารายงานไว้ใน README:
โหมด (--detail) | เก็บภาพจาก | เพดานเฟรม | เวลาดึง |
|---|---|---|---|
transcript | บทพูดอย่างเดียว | 0 ภาพ | ~4.5 วิ |
efficient | keyframe | 50 | ~0.5 วิ |
balanced | scene-change | 100 | ~21 วิ |
token-burner | scene-change | ไม่จำกัด | ~21 วิ |
(keyframe = "คีย์เฟรม" คือเฟรมสำคัญที่เป็นตัวแทนช่วงนั้น ๆ วิธีนี้เร็วเพราะไม่ต้องไล่เทียบทุกเฟรม ส่วน scene-change ช้ากว่าเพราะต้องเดินดูทั้งคลิปเพื่อจับจังหวะที่ภาพเปลี่ยน แต่ได้ภาพที่ตรงจุดกว่า)
เมื่อ Claude เห็นภาพในคลิปจริง ๆ งานหลายอย่างที่แต่ก่อนต้องเสียเวลานั่งเปิดดูเองก็ส่งต่อให้มันทำแทนได้:
และมันไม่ได้ดูแค่ยูทูบ เบื้องหลังใช้เครื่องมือชื่อ yt-dlp ("วายที-ดีแอลพี" โปรแกรมดาวน์โหลดวิดีโอ)
ที่รองรับแหล่งวิดีโอเป็นร้อยเว็บ ทั้ง TikTok, Instagram, X รวมถึงไฟล์วิดีโอในเครื่องเอง (.mp4, .mov, .mkv, .webm)
ครีเอเตอร์เลยเอาไปแกะโครงคลิป TikTok ของคู่แข่งได้ตรง ๆ ว่าเขาวางจังหวะเล่าเรื่องยังไง คลิปไหนยอดวิวพุ่งก็ดูได้เลยว่าส่วนไหนทำได้ดี
โดยไม่ต้องมานั่งเปิดดูเองซ้ำสิบรอบ
นี่คือจุดที่เซอร์ไพรส์คนส่วนใหญ่ คือต้นทุนของ /watch ไม่ได้ขึ้นกับว่าคลิปยาวกี่นาที แต่ขึ้นกับว่ามันดึงมากี่เฟรม
เพราะทุกเฟรมที่ส่งให้ Claude นับเป็น "หนึ่งรูป" และรูปกินโทเคนตามพื้นที่ภาพ (สูตรของ Anthropic คือ กว้าง × สูง ÷ 750
ที่ความละเอียดเริ่มต้น 512px เฟรมหนึ่งตกราว 197 โทเคน) ดึงเฟรมมาเยอะ ค่าใช้จ่ายก็สูงตาม
ผลที่ตามมาแบบทวนสัญชาตญาณคือ คลิปนิ่ง ๆ ยาว 49 นาทีอาจถูกกว่าคลิปหวือหวา 3 นาที เพราะคลิปอัดหน้าจอนิ่ง ๆ ภาพแทบไม่เปลี่ยน scene-change เลยคัดมาแค่ ~50 ภาพก็ครอบคลุมตั้งแต่ต้นจนจบ ส่วนคลิปตัดต่อรัว ๆ ภาพเปลี่ยนทุกวินาที กลับดึงเฟรมมาเพียบ
เคล็ดลับประหยัด
ถ้าคลิปยาวแต่คุณสนใจแค่บางช่วง ใส่ --start กับ --end บอกให้มันดูเฉพาะช่วงเวลาที่กำหนด
ประหยัดทั้งเวลาและเงิน หรือจะลดเพดานเฟรมด้วย --max-frames ก็ได้ และถ้าอยากได้แค่บทพูดไม่เอาภาพเลย ก็ --detail transcript
ติดตั้งไม่ยากอย่างที่กลัว บน Claude Code (โปรแกรมที่ใช้พิมพ์สั่งงาน Claude บนเครื่องเรา) แค่เพิ่ม marketplace แล้ว install พิมพ์สองบรรทัดนี้ในแชท (ส่งทีละบรรทัด):
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video เครื่องมือ AI สายโค้ดตัวอื่นอย่าง Codex, Cursor, Gemini CLI (และอีก 50+ ตัว) ก็ลงได้ด้วยคำสั่งเดียวใน terminal ครั้งแรกที่ใช้ มันจะติดตั้ง yt-dlp กับ ffmpeg ให้อัตโนมัติ (Whisper จะใช้ก็ต่อเมื่อคลิปไม่มี caption เท่านั้น):
npx skills add bradautomates/claude-video -g ระวังก่อนติดตั้ง
ปลั๊กอินจากภายนอกก็เหมือนโค้ดจากภายนอก ควรเปิดไฟล์ SKILL.md ของมันดูสักนิดว่ามันสั่งให้ Claude ทำอะไรบ้างก่อนติดตั้ง
โดยเฉพาะตัวที่ต้องดาวน์โหลดไฟล์จากเน็ตและรันคำสั่งในเครื่องเราแบบนี้
/watch เก่งเรื่องให้ Claude อ่านวิดีโอ (เอาคลิปเข้ามาเป็นข้อมูล) แต่ถ้าถามว่า Claude ช่วยงานตัดต่อวิดีโอได้ไหม
คำตอบคือได้ และมันเป็นคนละทิศทางกันพอดี อันหนึ่งคือ "ดูเข้ามา" อีกอันคือ "สร้างออกไป"
หัวใจที่ต้องเข้าใจก่อนคือ Claude ไม่ได้ลากไทม์ไลน์ตัดต่อไฟล์เอง มันทำตัวเป็น "คนคุมวง" ที่เขียนและสั่งรันคำสั่งของโปรแกรมชื่อ FFmpeg ให้ต่างหาก
แกะคำศัพท์
FFmpeg (อ่านว่า "เอฟเอฟ-เอ็มเพ็ก" ย่อจาก Fast Forward MPEG) คือโปรแกรมสายคอมมานด์ไลน์ที่เป็นเหมือน "มีดพับสวิสของงานวิดีโอ": ตัดคลิป รวมคลิป ย่อขนาด บีบไฟล์ แปลงฟอร์แมต ใส่ซับ เร่ง/หน่วงความเร็ว ทำได้เกือบหมดด้วยคำสั่งบรรทัดเดียว เครื่องมือตัดต่อดัง ๆ เบื้องหลังหลายตัวก็เรียกใช้ FFmpeg นี่แหละ ปัญหาเดียวคือคำสั่งมันจำยากและพารามิเตอร์เยอะมาก ซึ่งเป็นงานที่ Claude ถนัด
พูดง่าย ๆ คือเราคุยกับ Claude เป็นภาษาคน ("ตัดเอาช่วง 30 วินาทีแรกออก แล้วย่อความละเอียดเหลือ 720p") แล้วมันแปลงเป็นคำสั่ง FFmpeg
ที่ถูกต้องให้ พร้อมรันให้เลย เราไม่ต้องไปจำว่า -ss, -vf scale, -c:v คืออะไร มุมมองที่คนใช้จริงสรุปตรงกันคือ:
คุณค่าของ AI กับงานวิดีโอไม่ได้อยู่ที่การ "เจน" คลิปทั้งอันขึ้นมาใหม่ แต่อยู่ที่การ "บีบอัดและจัดโครง" ฟุตเทจจริงที่เรามีอยู่แล้ว
ไปป์ไลน์ที่คนทำจริงมักวางแบบนี้: Claude ช่วยแปลงสคริปต์หรือไอเดียเป็นรายการช็อต (shot list) และไทม์ไลน์คร่าว ๆ → เขียนคำสั่ง FFmpeg ไล่ตัด-รวม-ย่อ-บีบไฟล์เป็นชุด (batch) → แล้วสั่งรันเรนเดอร์ออกมาเป็นไฟล์สุดท้าย งานซ้ำ ๆ อย่างตัดหัวท้ายคลิปทั้งโฟลเดอร์ หรือแปลงฟอร์แมตหลายสิบไฟล์ให้เหมือนกัน กลายเป็นสั่งทีเดียวจบ
จุดที่สวยที่สุดคือตอนสองฝั่งนี้มาบรรจบกัน: ใช้ /watch ดูคลิปคู่แข่งหรือฟุตเทจดิบเพื่อเข้าใจว่าอะไรเวิร์ก
แล้วสั่ง Claude ให้ใช้ FFmpeg ลงมือตัดคลิปของเราตามนั้น ครบวงจร "ดู → คิด → ตัด" ในเครื่องมือเดียว
และ FFmpeg เป็นแค่ประตูบานแรกของฝั่ง "ตัดต่อ" Claude ยังคุมโปรแกรมตัดต่อจริงอย่าง CapCut หรือ Premiere Pro ได้ด้วย ซึ่งลงลึกกว่านี้มาก บทความถัดไปพาไปติดตั้งและลองทีละเส้นทาง พร้อมข้อควรระวังที่ต้องรู้ก่อนเปิดประตูให้มัน
เมื่อก่อน Claude ได้แค่เดาเนื้อหาจากชื่อคลิป วันนี้มันดูเป็น (ผ่าน /watch ที่คัดเฉพาะเฟรมสำคัญบวกบทพูด)
และตัดต่อเป็น (ผ่านการคุม FFmpeg) วิดีโอเลิกเป็นกล่องดำสำหรับ AI ไปแล้ว
ครั้งหน้าที่เจอคลิปที่อยากรู้ว่าข้างในมีอะไร ลองใช้ /watch ให้มันดูสักคลิป ถามหนึ่งคำถามที่อยากรู้
แล้วเทียบกับตอนที่มันได้แค่เดาจากชื่อคลิป คุณจะเห็นเองว่าคำตอบมันต่างกันแค่ไหน
เรียบเรียงและอธิบายใหม่ด้วยคำตัวเอง โดยตรวจสอบข้อเท็จจริงกับแหล่งปฐมภูมิด้านล่าง (ค่าตัวเลขเฟรม/เวลา/โทเคนเป็นค่าที่ผู้พัฒนารายงานไว้ใน README ณ วันสืบค้น อาจเปลี่ยนได้ตามเวอร์ชัน)