ขนาดชังก์

ขนาด Chunk หมายถึง ขนาดของหน่วยการแบ่ง (จำนวน Token หรือจำนวนตัวอักษร) ที่ใช้ในการแบ่งเอกสารเพื่อจัดเก็บลงใน Vector Store ภายใน RAG Pipeline ถือเป็น Parameter สำคัญที่ส่งผลโดยตรงต่อความแม่นยำในการค้นหาและคุณภาพของคำตอบ
เหตุใดจึงต้องแบ่งส่วนข้อมูล
Context window ของ LLM มีขีดจำกัด เราไม่สามารถส่งคู่มือภายในองค์กรที่มีหลายร้อยหน้าเข้าไปได้โดยตรง จึงจำเป็นต้องแบ่งเอกสารออกเป็นส่วนย่อยในระดับความละเอียดที่เหมาะสม (chunking) แล้วแปลงเป็นเวกเตอร์ เพื่อให้สามารถค้นหาและดึงเฉพาะส่วนที่เกี่ยวข้องกับคำถามได้ ในกระบวนการนี้ "ควรตัดด้วยขนาดเท่าใด" คือปัญหาของ chunk size
ใหญ่เกินไปหรือเล็กเกินไปก็มีปัญหา
หาก chunk มีขนาดเล็กเกินไป บริบทที่บรรจุอยู่ใน chunk เดียวจะไม่เพียงพอ แม้จะค้นหาพบแต่ LLM ก็ขาดข้อมูลที่จำเป็นสำหรับการสร้างคำตอบ ในทางกลับกัน หากใหญ่เกินไป ข้อมูลที่ไม่เกี่ยวข้องจะปะปนเข้ามาเป็น noise ทำให้ความแม่นยำของคำตอบลดลง และยังเพิ่ม token cost อีกด้วย
โดยทั่วไปมักใช้ประมาณ 256–1,024 token เป็นจุดเริ่มต้น แต่ค่าที่เหมาะสมที่สุดขึ้นอยู่กับโดเมนและลักษณะของคำถาม แนวทางพื้นฐานในทางปฏิบัติคือ หากเป็นเอกสารแบบ Q&A สั้น ๆ อย่าง FAQ ให้ตั้งค่าขนาดเล็ก แต่หากเป็นเอกสารข้อกำหนดทางเทคนิคที่บริบทก่อนหน้าและหลังมีความสำคัญ ให้ตั้งค่าขนาดใหญ่ขึ้น
เทคนิค overlap
เพื่อบรรเทาปัญหาบริบทที่ขาดหายไปที่ขอบเขตของ chunk มักนิยมใช้ "overlap" ซึ่งเป็นการทำให้ chunk ที่อยู่ติดกันมีส่วนซ้อนทับกันบางส่วน ตัวอย่างเช่น หาก chunk size คือ 512 token และ overlap คือ 64 token แล้ว 64 token สุดท้ายของ chunk ก่อนหน้าจะถูกรวมไว้ที่ต้นของ chunk ถัดไปด้วย วิธีนี้ช่วยเพิ่มความแม่นยำของการค้นหาด้วย BM25 และ vector search แต่จะทำให้ขนาดของ storage และ index เพิ่มขึ้น
บทความที่กล่าวถึงคำศัพท์นี้
- 10 ข้อผิดพลาดในการสร้าง RAG และวิธีแก้ไข — ป้องกันปัญหาที่อาจเกิดขึ้นในการใช้งานจริงเจาะลึก 10 ข้อผิดพลาดที่พบบ่อยในการทำ RAG ทั้งก่อนและหลังใช้งานจริง ตั้งแต่การแบ่ง Chunk การเพิ่มความแม่นยำในการค้นหา ไปจนถึงวิธีแก้ปัญหา Hallucination
- Hybrid Search คืออะไร? กลไกและวิธีเพิ่มความแม่นยำให้ RAG ด้วย Vector Search และ Full-Text Searchอธิบายกลไก Hybrid Search ผ่าน Vector Search, BM25 และ RRF พร้อมสรุปเทคนิคการออกแบบเพื่อเพิ่มความแม่นยำให้ RAG และข้อควรระวังในการใช้งานจริง
- คู่มือการเพิ่มประสิทธิภาพต้นทุน LLM — การลดโทเค็น การเลือกโมเดล และการทำแคชคู่มือลดต้นทุนการใช้งาน LLM ในระดับโปรดักชัน ด้วย 4 กลยุทธ์: การปรับแต่ง Token, การเลือก Model, Prompt Cache และ RAG เพื่อลดค่าใช้จ่ายรายเดือนลงครึ่งหนึ่งโดยยังคงความแม่นยำไว้ได้
- Token Trap คืออะไร? วิธีจัดการการใช้งานเพื่อป้องกันค่าใช้จ่ายพุ่งสูงใน AI Agentทำความเข้าใจกลไก "Token Trap" ที่ทำให้ค่าใช้จ่ายพุ่งสูงจาก Agent Loop พร้อมวิธีป้องกันด้วยการตั้งงบประมาณ, Throttling และการออกแบบ Loop ให้มีประสิทธิภาพ
คำศัพท์ที่เกี่ยวข้อง

RRF
RRF (Reciprocal Rank Fusion) คือวิธีการให้คะแนนเพื่อรวมผลลัพธ์การจัดอันดับจากหลายวิธีการค้นหาเข้าด้ว

Agentic RAG
Agentic RAG คือสถาปัตยกรรมที่ LLM ทำหน้าที่เป็น Agent โดยวนซ้ำกระบวนการสร้าง Query ค้นหา ประเมินผลลั

เอ็มเบดดิง (Embedding)
เอ็มเบดดิง (Embedding) คือเทคนิคที่แปลงข้อมูลไม่มีโครงสร้าง เช่น ข้อความ รูปภาพ และเสียง ให้เป็นเวกเ

GraphRAG
สถาปัตยกรรม RAG รุ่นถัดไปที่ผสมผสาน Knowledge Graph และการค้นหาแบบ Vector เข้าด้วยกัน โดยใช้ประโยชน์



