Agentic RAG

Agentic RAG ແມ່ນສະຖາປັດຕະຍະກຳທີ່ LLM ເຮັດໜ້າທີ່ເປັນ agent ໂດຍການສ້າງ query ການຄົ້ນຫາ, ປະເມີນຜົນລັບ, ແລະຕັດສິນໃຈຄົ້ນຫາຄືນໃໝ່ຢ່າງອັດຕະໂນມັດຊ້ຳໆ ເພື່ອບັນລຸຄວາມຖືກຕ້ອງຂອງຄຳຕອບທີ່ RAG ແບບຖາມ-ຕອບທຳມະດາບໍ່ສາມາດໃຫ້ໄດ້.
ຄວາມແຕກຕ່າງຈາກ RAG ແບບດັ້ງເດີມ
RAG pipeline ມາດຕະຖານເຮັດວຽກໃນຮູບແບບເສັ້ນຊື່ວ່າ "ຄຳຖາມຂອງຜູ້ໃຊ້ → ການຄົ້ນຫາດ້ວຍ vector → ສົ່ງເອກະສານທີ່ດຶງມາໃຫ້ LLM → ສ້າງຄຳຕອບ". ຖ້າຈຸດປະສົງຂອງຄຳຖາມຊັດເຈນ ແລະ ສາມາດດຶງຂໍ້ມູນທີ່ຕ້ອງການໄດ້ໃນການຄົ້ນຫາຄັ້ງດຽວ ວິທີນີ້ກໍ່ພຽງພໍ, ແຕ່ໃນການໃຊ້ງານຈິງ ມັກເກີດກໍລະນີທີ່ຂໍ້ມູນທີ່ຕ້ອງການບໍ່ຄົບຖ້ວນຈາກການຄົ້ນຫາຄັ້ງດຽວຢູ່ເລື້ອຍໆ.
ໃນ Agentic RAG, LLM ເອງຈະເປັນຜູ້ຕັດສິນວ່າ "ຜົນການຄົ້ນຫາບໍ່ພຽງພໍຫຼືບໍ່" ຫຼື "ຄວນປ່ຽນ query ຫຼືບໍ່", ແລ້ວຂຽນ query ໃໝ່ ຫຼື ສອບຖາມຈາກ data source ອື່ນຕາມຄວາມຈຳເປັນ. ໂດຍການຝັງ multi-step reasoning ເຂົ້າໄປ, ຈຶ່ງສາມາດເກັບກຳ ແລະ ລວມຂໍ້ມູນຫຼາຍຢ່າງເປັນຂັ້ນຕອນ ເພື່ອສ້າງຄຳຕອບສຸດທ້າຍໄດ້.
ມີປະສິດທິພາບໃນສະຖານະການໃດ
ລອງພິຈາລະນາຕົວຢ່າງການຖາມ knowledge base ພາຍໃນອົງກອນ. ຄຳຖາມວ່າ "ແມ່ນແບບ template ການສະເໜີໃດທີ່ຖືກໃຊ້ໃນ 3 ໂຄງການທີ່ມີຍອດຂາຍສູງສຸດໃນເດືອນທີ່ຜ່ານມາ" ຕ້ອງການຫຼາຍຂັ້ນຕອນ ໄດ້ແກ່ ການຄົ້ນຫາຂໍ້ມູນຍອດຂາຍ → ການລະບຸໂຄງການ → ການຄົ້ນຫາເອກະສານການສະເໜີຂອງແຕ່ລະໂຄງການ. ໂດຍໃຫ້ agent ຮັບຜິດຊອບການແຍກຍ່ອຍ ແລະ ການຄົ້ນຫາຕາມລຳດັບນີ້, ຜູ້ໃຊ້ຈຶ່ງສາມາດໄດ້ຮັບຄຳຕອບດ້ວຍການຖາມຄັ້ງດຽວ.
ຢ່າງໃດກໍ່ຕາມ, ຍິ່ງຈຳນວນຮອບ loop ຂອງ agent ເພີ່ມຂຶ້ນ, latency ແລະ ຄ່າໃຊ້ຈ່າຍ token ກໍ່ຈະສູງຂຶ້ນຕາມ. ການກຳນົດຂີດຈຳກັດຮອບ loop ແລະ ການອອກແບບໃຫ້ສົ່ງຄືນຄວາມຄືບໜ້າລະຫວ່າງທາງດ້ວຍ streaming ແມ່ນສິ່ງທີ່ຂາດບໍ່ໄດ້ໃນການໃຊ້ງານຈິງ.
ບົດຄວາມທີ່ກ່າວເຖິງຄຳສັບນີ້
- 10 ຮູບແບບຄວາມຜິດພາດໃນການສ້າງ RAG ແລະ ວິທີຫຼີກລ່ຽງ — ປ້ອງກັນບັນຫາໃນການນຳໃຊ້ຈິງລ່ວງໜ້າແນະນຳ 10 ຂໍ້ຜິດພາດທີ່ມັກພົບໃນການສ້າງ RAG ກ່ອນ ແລະ ຫຼັງນຳໃຊ້ຈິງ. ຮຽນຮູ້ວິທີແກ້ໄຂບັນຫາການອອກແບບ Chunk, ຄວາມຖືກຕ້ອງໃນການຄົ້ນຫາ ແລະ Hallucination.
- ວິທີເລືອກລະຫວ່າງ Fine-tuning ແລະ RAG: ຄູ່ມືພາກປະຕິບັດໃນການປຽບທຽບດ້ານຕົ້ນທຶນ, ຄວາມແມ່ນຍຳ ແລະ ການນຳໃຊ້ຄວນເລືອກ Fine-tuning ຫຼື RAG? ປຽບທຽບ 4 ປັດໄຈ: ຄ່າໃຊ້ຈ່າຍ, ຄວາມແມ້ນຍຳ, ຄວາມຖີ່ໃນການອັບເດດ ແລະ ຄວາມປອດໄພ ພ້ອມແນະນຳວິທີເລືອກໃຫ້ເໝາະສົມກັບວຽກ.
- Adaptive RAG ແມ່ນຫຍັງ? ວິທີສ້າງຄວາມສົມດຸນລະຫວ່າງຕົ້ນທຶນ ແລະ ຄວາມແມ້ນຍຳດ້ວຍການຄົ້ນຫາແບບ Dynamic ທີ່ຂັບເຄື່ອນດ້ວຍ Query
- ການອອກແບບງົບປະມານ Latency ສຳລັບ AI Agent — ວິທີຄວບຄຸມການແລກປ່ຽນ ຫຼື Trade-off ລະຫວ່າງເວລາຄິດ ແລະ ເວລາຕອບສະໜອງອະທິບາຍບັນຫາ "ເວລາຄິດ" ໃນ Multi-step reasoning agent ທີ່ເຮັດໃຫ້ເກີດຄວາມຊັກຊ້າ, ພ້ອມປຽບທຽບການຈັດສັນ Latency budget ແລະ ຮູບແບບການນຳໃຊ້ຕາມຄວາມຊັບຊ້ອນ.
ຄຳສັບທີ່ກ່ຽວຂ້ອງ

RRF
RRF (Reciprocal Rank Fusion) ແມ່ນວິທີການໃຫ້ຄະແນນທີ່ລວມເອົາຜົນລັດຂອງການຈັດອັນດັບຈາກຫຼາຍວິທີການຄົ້ນຫາເ

ເອັມເບັດດິງ (Embedding)
ເອັມເບັດດິງ (Embedding) ແມ່ນເທັກນິກທີ່ແປງຂໍ້ມູນທີ່ບໍ່ມີໂຄງສ້າງ ເຊັ່ນ ຂໍ້ຄວາມ, ຮູບພາບ ແລະ ສຽງ ໃຫ້ເປັນ

GraphRAG
ສະຖາປັດຕະຍະກຳ RAG ລຸ້ນໃໝ່ທີ່ລວມເອົາ Knowledge Graph ແລະ Vector Search ເຂົ້າດ້ວຍກັນ ເພື່ອນຳໃຊ້ຄວາມສຳພ

Gemini Embedding 2
Gemini Embedding 2 ແມ່ນໂມເດລ embedding ທີ່ຮອງຮັບ multimodal ທີ່ພັດທະນາໂດຍ Google ສາມາດແປງຂໍ້ຄວາມ, ຮູ



