BM25

BM25 (Best Matching 25) ແມ່ນ algorithm ການຄົ້ນຫາຂໍ້ມູນແບບຄວາມເປັນໄປໄດ້ທີ່ໃຊ້ການໃຫ້ຄະແນນຄວາມກ່ຽວຂ້ອງກັບ query ໂດຍພິຈາລະນາຄວາມຖີ່ຂອງການປາກົດຂຶ້ນຂອງຄຳສັບໃນເອກະສານ ແລະ ຄວາມຍາວຂອງເອກະສານ.
ໃນຖານະທີ່ເປັນການພັດທະນາຕໍ່ຈາກ TF-IDF
BM25 ແມ່ນຟັງຊັນການຈັດອັນດັບທີ່ຂະຫຍາຍແນວຄິດຂອງ TF-IDF ໂດຍຖືກໃຊ້ເປັນ algorithm ເລີ່ມຕົ້ນຂອງ search engine ຂໍ້ຄວາມເຕັມຮູບແບບຫຼັກໆ ເຊັ່ນ Elasticsearch ແລະ Apache Solr ມາເປັນເວລາດົນນານ. ຈຸດເດັ່ນຂອງມັນຄືການໃຊ້ saturation function ເພື່ອປັບແກ້ຄວາມຮູ້ສຶກທີ່ວ່າ "ຄຳທີ່ປາກົດໃນເອກະສານຫຼາຍເທົ່າໃດ ຄວາມກ່ຽວຂ້ອງກໍ່ຍິ່ງສູງຂຶ້ນ". ເຖິງແມ່ນຈຳນວນການປາກົດຂອງຄຳຈະເພີ່ມຂຶ້ນ ຄະແນນກໍ່ຈະບໍ່ສູງຂຶ້ນໂດຍບໍ່ມີຂອບເຂດ ແຕ່ຈະຢຸດຢູ່ທີ່ລະດັບໜຶ່ງ.
parameter ຫຼັກມີ 2 ຕົວ. k1 ຄວບຄຸມຄວາມໄວຂອງການອີ່ມຕົວຂອງຄວາມຖີ່ຂອງຄຳ ແລະ b ປັບຄວາມແຮງຂອງການ normalization ຕາມຄວາມຍາວຂອງເອກະສານ. ສ່ວນໃຫຍ່ມັກໃຊ້ຄ່າເລີ່ມຕົ້ນ (k1=1.2, b=0.75) ໂດຍກົງ ແຕ່ສຳລັບ corpus ທີ່ສະເພາະໂດເມນ ການ tuning ອາດຊ່ວຍປັບປຸງຄວາມຖືກຕ້ອງຂອງການຄົ້ນຫາໄດ້.
ຕຳແໜ່ງໃນ RAG pipeline
ເຖິງແມ່ນ vector search (semantic search) ຈະໄດ້ຮັບຄວາມສົນໃຈ BM25 ກໍ່ຍັງເຂັ້ມແຂງໃນການຄົ້ນຫາທີ່ຕ້ອງການຈັບຄູ່ຄຳຄົບຖ້ວນ ຫຼືຄຳສັບທາງວິຊາການ. ໃນທາງປະຕິບັດ ຮູບແບບ hybrid search ທີ່ໃຊ້ BM25 ແລະ vector search ຮ່ວມກັນ ແລ້ວລວມຄະແນນດ້ວຍ RRF (Reciprocal Rank Fusion) ໄດ້ກາຍເປັນຮູບແບບມາດຕະຖານ.
ສຳລັບ query ທີ່ "ການຈັບຄູ່ສາຍອັກສອນ" ສຳຄັນກວ່າ "ຄວາມໝາຍ" ເຊັ່ນ ຊື່ສະເພາະ ຫຼື ລະຫັດລຸ້ນ ໂຄງສ້າງ hybrid ທີ່ລວມ BM25 ໄວ້ຈະໃຫ້ຜົນທີ່ໝັ້ນຄົງກວ່າ vector search ຢ່າງດຽວ.
ບົດຄວາມທີ່ກ່າວເຖິງຄຳສັບນີ້
- 10 ຮູບແບບຄວາມຜິດພາດໃນການສ້າງ RAG ແລະ ວິທີຫຼີກລ່ຽງ — ປ້ອງກັນບັນຫາໃນການນຳໃຊ້ຈິງລ່ວງໜ້າແນະນຳ 10 ຂໍ້ຜິດພາດທີ່ມັກພົບໃນການສ້າງ RAG ກ່ອນ ແລະ ຫຼັງນຳໃຊ້ຈິງ. ຮຽນຮູ້ວິທີແກ້ໄຂບັນຫາການອອກແບບ Chunk, ຄວາມຖືກຕ້ອງໃນການຄົ້ນຫາ ແລະ Hallucination.
- Hybrid Search ແມ່ນຫຍັງ? ກົນໄກແລະການນຳໃຊ້ Vector Search x Full-text Search ເພື່ອຍົກລະດັບຄວາມແມ່ນຍຳຂອງ RAGອະທິບາຍກົນໄກ Hybrid Search ຜ່ານ Vector Search, BM25 ແລະ RRF. ສະຫຼຸບຮູບແບບການອອກແບບເພື່ອເພີ່ມຄວາມແມ່ນຍຳຂອງ RAG ແລະຂໍ້ຄວນລະວັງໃນການປະຕິບັດງານ.
- ຖານຂໍ້ມູນ Vector ແມ່ນຫຍັງ? ຄູ່ມືຄົບຖ້ວນກ່ຽວກັບວິທີການເຮັດວຽກ, ການປຽບທຽບຜະລິດຕະພັນຊັ້ນນຳ, ແລະ ການນຳໃຊ້ RAGຈາກແນວຄິດພື້ນຖານຂອງ vector database ຈົນເຖິງການປຽບທຽບ Pinecone, Weaviate, ແລະ pgvector ລວມທັງການເຊື່ອມຕໍ່ RAG — ຄູ່ມືຊັດເຈນສຳລັບຜູ້ຈັດການ AI.
- ວິທີເລືອກລະຫວ່າງ Fine-tuning ແລະ RAG: ຄູ່ມືພາກປະຕິບັດໃນການປຽບທຽບດ້ານຕົ້ນທຶນ, ຄວາມແມ່ນຍຳ ແລະ ການນຳໃຊ້ຄວນເລືອກ Fine-tuning ຫຼື RAG? ປຽບທຽບ 4 ປັດໄຈ: ຄ່າໃຊ້ຈ່າຍ, ຄວາມແມ້ນຍຳ, ຄວາມຖີ່ໃນການອັບເດດ ແລະ ຄວາມປອດໄພ ພ້ອມແນະນຳວິທີເລືອກໃຫ້ເໝາະສົມກັບວຽກ.
ຄຳສັບທີ່ກ່ຽວຂ້ອງ

RRF
RRF (Reciprocal Rank Fusion) ແມ່ນວິທີການໃຫ້ຄະແນນທີ່ລວມເອົາຜົນລັດຂອງການຈັດອັນດັບຈາກຫຼາຍວິທີການຄົ້ນຫາເ

Agentic RAG
Agentic RAG ແມ່ນສະຖາປັດຕະຍະກຳທີ່ LLM ເຮັດໜ້າທີ່ເປັນ agent ໂດຍການສ້າງ query ການຄົ້ນຫາ, ປະເມີນຜົນລັບ,

ເອັມເບັດດິງ (Embedding)
ເອັມເບັດດິງ (Embedding) ແມ່ນເທັກນິກທີ່ແປງຂໍ້ມູນທີ່ບໍ່ມີໂຄງສ້າງ ເຊັ່ນ ຂໍ້ຄວາມ, ຮູບພາບ ແລະ ສຽງ ໃຫ້ເປັນ

GraphRAG
ສະຖາປັດຕະຍະກຳ RAG ລຸ້ນໃໝ່ທີ່ລວມເອົາ Knowledge Graph ແລະ Vector Search ເຂົ້າດ້ວຍກັນ ເພື່ອນຳໃຊ້ຄວາມສຳພ



