เอ็มเบดดิง (Embedding)

เอ็มเบดดิง (Embedding) คือเทคนิคที่แปลงข้อมูลไม่มีโครงสร้าง เช่น ข้อความ รูปภาพ และเสียง ให้เป็นเวกเตอร์ตัวเลขความยาวคงที่ โดยยังรักษาความสัมพันธ์เชิงความหมาย
คอมพิวเตอร์ไม่สามารถตัดสินจากสตริงว่า "แอปเปิ้ล" กับ "ส้ม" มีความคล้ายกัน เอ็มเบดดิงแก้ปัญหานี้ เมื่อ "แอปเปิ้ล" ถูกแปลงเป็นเวกเตอร์อย่าง [0.23, -0.41, 0.87, ...] ที่มีหลายร้อยมิติ เวกเตอร์ของ "ส้ม" จะอยู่ใกล้ แต่ "รถยนต์" จะอยู่ไกล ความใกล้เคียงเชิงความหมายกลายเป็นความใกล้เคียงเชิงตัวเลข
เอ็มเบดดิงมีบทบาทหลักภายใน LLM เช่นกัน ข้อความอินพุตถูก Tokenize ก่อน จากนั้นแต่ละ Token จะถูกแปลงเป็นเวกเตอร์เอ็มเบดดิง Transformer ประมวลผลลำดับเวกเตอร์นี้เพื่อสร้างเอาต์พุต
ในทางปฏิบัติ เอ็มเบดดิงระดับประโยคถูกใช้บ่อยที่สุด โมเดลอย่าง text-embedding-3-small ของ OpenAI หรือ embed-v4 ของ Cohere แปลงประโยคทั้งหมดเป็นเวกเตอร์เดียว การจัดเก็บเวกเตอร์เหล่านี้ในฐานข้อมูลเวกเตอร์ทำให้สร้าง Semantic Search และชั้นค้นหาสำหรับ RAG ได้
ในการเลือกโมเดล จำนวนมิติ ภาษาที่รองรับ และต้นทุนเป็นเกณฑ์หลัก สำหรับภาษาไทยหรือภาษาญี่ปุ่น การทดสอบความแม่นยำของโมเดลหลายภาษาล่วงหน้าเป็นสิ่งสำคัญ
บทความที่กล่าวถึงคำศัพท์นี้
- ฐานข้อมูลเวกเตอร์คืออะไร? อธิบายครบจบ ตั้งแต่หลักการทำงาน เปรียบเทียบผลิตภัณฑ์หลัก ไปจนถึงการใช้งาน RAGอธิบายแนวคิดพื้นฐานของ Vector Database เปรียบเทียบผลิตภัณฑ์หลักอย่าง Pinecone, Weaviate, pgvector และการนำไปใช้ใน RAG System สำหรับผู้รับผิดชอบด้าน AI
- 10 ข้อผิดพลาดในการสร้าง RAG และวิธีแก้ไข — ป้องกันปัญหาที่อาจเกิดขึ้นในการใช้งานจริงเจาะลึก 10 ข้อผิดพลาดที่พบบ่อยในการทำ RAG ทั้งก่อนและหลังใช้งานจริง ตั้งแต่การแบ่ง Chunk การเพิ่มความแม่นยำในการค้นหา ไปจนถึงวิธีแก้ปัญหา Hallucination
- Hybrid Search คืออะไร? กลไกและวิธีเพิ่มความแม่นยำให้ RAG ด้วย Vector Search และ Full-Text Searchอธิบายกลไก Hybrid Search ผ่าน Vector Search, BM25 และ RRF พร้อมสรุปเทคนิคการออกแบบเพื่อเพิ่มความแม่นยำให้ RAG และข้อควรระวังในการใช้งานจริง
คำศัพท์ที่เกี่ยวข้อง

NotebookLM (ปัจจุบันคือ Gemini Notebook)
NotebookLM คือ AI แบบสมุดโน้ตของ Google ที่สรุป ตอบคำถาม และสร้างเสียงบรรยายโดยอิงเฉพาะเอกสารที่อัปโ

RRF
RRF (Reciprocal Rank Fusion) คือวิธีการให้คะแนนเพื่อรวมผลลัพธ์การจัดอันดับจากหลายวิธีการค้นหาเข้าด้ว

Agentic RAG
Agentic RAG คือสถาปัตยกรรมที่ LLM ทำหน้าที่เป็น Agent โดยวนซ้ำกระบวนการสร้าง Query ค้นหา ประเมินผลลั

GraphRAG
สถาปัตยกรรม RAG รุ่นถัดไปที่ผสมผสาน Knowledge Graph และการค้นหาแบบ Vector เข้าด้วยกัน โดยใช้ประโยชน์


