Knowledge Engineering · Output

RAG ของคุณแสดงแหล่งที่มา แต่ไม่ได้บอกว่าแหล่งเหล่านั้นลับแค่ไหน

ทีมของคุณสร้าง RAG ไว้บนเอกสารขององค์กรเอง โดยมีดัชนีค้นหา โมเดล และการอ้างอิงกำกับทุกคำตอบ ซึ่งแก้ปัญหาจริงไปได้ข้อหนึ่ง แต่ก็ซ่อนปัญหาอีกข้อไว้ด้วย การอ้างอิงบอกผู้อ่านว่าคำตอบมาจากเอกสารฉบับไหน แต่ไม่ได้บอกว่าเอกสารนั้นคืออะไร หรือคำตอบที่เขากำลังจะส่งต่อ ตอนนี้กลายเป็นเอกสารที่มีระดับความลับสูงที่สุดในมือเขาไปแล้วหรือยัง ทำไมถึงเป็นแบบนั้น? เพราะในวิธีสร้าง RAG แบบทั่วไป ไม่มีขั้นตอนไหนที่ทำให้ระดับความลับของเอกสารติดไปกับคำตอบด้วย ทางออกคือเลเยอร์ข้อมูลที่มี Governance ซึ่งทำให้ระดับความลับติดไปกับคำตอบ คำตอบจะรับ Classification ที่เข้มที่สุดของทุกอย่างที่ประกอบมันขึ้นมา

Infozense Knowledge Engineering · CISO · GRC · Head of Data · ~6 นาที

นี่คือบท Output ของชุดบทความ Infozense Knowledge Engineering เลเยอร์ข้อมูลที่อยู่ใต้ Agent ของคุณมี Gate อยู่ห้าตัว: Input (ใครมีสิทธิ์ถาม) · Egress (อะไรออกไปได้) · Output (ปลอดภัยและเป็นจริง) · Action (ใครอนุมัติ) · Operational (พิสูจน์ได้ภายหลัง) บทความนี้ว่าด้วยตัวที่สาม: Output ซึ่งเป็น Gate ที่กำกับตัวคำตอบเอง หลังจากที่โมเดลเขียนมันออกมาแล้ว

เมื่อยังไม่มีเลเยอร์ข้อมูลที่มี Governance เอกสารต้นทางสี่ฉบับ แต่ละฉบับมี Classification ติดอยู่ โมเดลอ่านทั้งสี่ฉบับนั้น แล้วเขียนคำตอบใหม่ออกมา ซึ่งไม่มีป้ายกำกับใด ๆ ติดอยู่เลย จากนั้นคำตอบก็ถูกส่งต่อเข้าอีเมล เข้าช่องแชทที่ใช้ร่วมกัน และเข้าสไลด์สำหรับลูกค้าเมื่อยังไม่มีเลเยอร์ข้อมูลที่มี Governance เอกสารต้นทางสี่ฉบับ แต่ละฉบับมี Classification ติดอยู่ โมเดลอ่านทั้งสี่ฉบับนั้น แล้วเขียนคำตอบใหม่ออกมา ซึ่งไม่มีป้ายกำกับใด ๆ ติดอยู่เลย จากนั้นคำตอบก็ถูกส่งต่อเข้าอีเมล เข้าช่องแชทที่ใช้ร่วมกัน และเข้าสไลด์สำหรับลูกค้า
โมเดลอ่านเอกสารสี่ฉบับที่มีป้ายกำกับ แล้วเขียนคำตอบที่ไม่มีป้ายกำกับใด ๆ เลย

ตอนที่ทีมของคุณนำผู้ช่วย AI มาใช้กับเอกสารขององค์กรเอง การทำให้มันอ้างอิงเอกสารได้น่าจะเป็นสิ่งแรกที่ทีมของคุณทำ และก็ทำถูกแล้ว

คำตอบของมันจึงมีแหล่งที่มาติดมาด้วย ทุกประเด็นในคำตอบชี้ไปที่เอกสารฉบับหนึ่งขององค์กรคุณเอง ผู้อ่านที่สงสัยอะไรก็คลิกเข้าไปตรวจได้ ปัญหาเรื่องความโปร่งใสในแบบที่เคยตั้งโจทย์ไว้ ถือว่าแก้ได้แล้ว

แต่นี่คือสิ่งที่การอ้างอิงไม่ได้บอกพวกเขา

มันไม่ได้บอกว่าแหล่งเหล่านั้นคืออะไร ลิงก์บอกผู้อ่านว่าคำตอบมาจากไหน แต่ไม่ได้บอกเลยว่าเนื้อหาที่อยู่หลังลิงก์นั้นคือเอกสารแนะนำผลิตภัณฑ์ที่เผยแพร่แล้ว หรือคือแฟ้มคดี จึงไม่ได้บอกด้วยว่าคำตอบที่อยู่ตรงหน้าพวกเขาตอนนี้คืออะไร

และนั่นสำคัญ เพราะคำตอบนั้นกำลังจะถูกส่งต่อ

บทความนี้เขียนถึงใคร

ถ้าทุกอย่างที่ AI ของคุณเข้าถึงได้เป็นเนื้อหาที่ใครในองค์กรก็อ่านได้ นี่ไม่ใช่ปัญหาของคุณ หยุดอ่านตรงนี้ได้เลย

บทความนี้เขียนถึงคุณ ถ้า AI ของคุณใช้เอกสารที่มีระดับความลับต่างกัน และคนที่นำคำตอบไปใช้ ไม่รู้ว่าคำตอบนั้นมีเนื้อหาจากเอกสารลับปนอยู่ เช่น

  • เจ้าหน้าที่กำกับดูแลที่คัดลอกบทสรุปไปวางในอีเมล
  • หัวหน้าทีมที่ส่งคำตอบต่อในกลุ่มแชท
  • นักวิเคราะห์ที่นำย่อหน้าหนึ่งไปใส่ในสไลด์ให้ลูกค้า

ไม่มีใครในนั้นประมาท เพียงแต่บนหน้าจอไม่มีอะไรบอกเขาว่าคำตอบนั้นมีเนื้อหาจากเอกสารลับปนอยู่

ลองทดสอบง่าย ๆ ให้คนที่มีสิทธิ์อ่านเอกสารลับฉบับหนึ่ง ถามคำถามกับ AI ของคุณข้อหนึ่ง ที่ต้องใช้ทั้งเอกสารลับฉบับนั้นและเอกสารทั่วไปในการตอบ แล้วดูให้แน่ใจว่าเอกสารลับนั้นอยู่ในแหล่งที่มาที่คำตอบอ้างอิง จากนั้นดูสองเรื่อง

  1. บนหน้าจอมีป้ายบอกระดับความลับของคำตอบไหม เช่น สาธารณะ ใช้ภายใน หรือลับ โดยไม่นับข้อความที่ AI เขียนเอง
  2. ถ้ามีป้ายระดับความลับ ลองถามทีมที่สร้างระบบว่า ป้ายนั้นเป็นตัวเดียวกันกับตัวที่ระบบใช้ตัดสินว่าเอกสารลับส่งให้โมเดลภายนอกอ่านได้หรือไม่

ถ้าข้อใดข้อหนึ่งตอบว่าไม่ บทความนี้เขียนถึงคุณ

AI เขียนคำตอบขึ้นใหม่ แต่ระดับความลับไม่ได้ติดมาด้วย

องค์กรของคุณใช้เวลาหลายปีกำหนดระดับความลับให้เอกสาร แฟ้มคดี เอกสารประชุมบอร์ด และประวัติพนักงาน ล้วนมีป้ายบอกว่าลับแค่ไหน และคนในองค์กรก็ถูกฝึกให้ดูป้ายนั้นก่อนส่งต่อ

แต่คำตอบจาก AI ไม่ใช่เอกสารที่มีอยู่แล้ว โมเดลอ่านเอกสารสี่ฉบับ แล้วเขียนข้อความใหม่ขึ้นมาเอง และใน RAG ทั่วไป ก็ไม่มีขั้นตอนไหนที่นำระดับความลับของเอกสารทั้งสี่มาคำนวณให้คำตอบนี้ คำตอบจึงปรากฏในหน้าต่างแชทโดยไม่มีป้ายใด ๆ ติดอยู่

ถ้าให้ AI บอกเองว่าคำตอบลับแค่ไหน ก็ได้แค่การคาดเดา โมเดลจะเขียนคำตอบที่ฟังดูสมเหตุสมผล แต่ไม่ได้มาจากกติกาที่ตรวจสอบได้ และถามซ้ำก็อาจได้คำตอบต่างกัน

RAG ทั่วไป
1. ค้นเจอเอกสารสี่ฉบับ
เอกสารแนะนำผลิตภัณฑ์สาธารณะ
ประกาศเวอร์ชันใหม่สาธารณะ
แฟ้มคดีลับ
นโยบายที่เผยแพร่แล้วสาธารณะ
→
2. โมเดลเขียนคำตอบ โดยเลือกว่าจะเขียนอะไรต่อ
“เรื่องร้องเรียนถูกปิดเพราะ …”
จ่ายเงินคืนแล้ว
41%
แก้ปัญหาแล้ว
33%
ลูกค้าถอนเรื่อง
18%
คำอื่น ๆ
8%
โมเดลเลือกสิ่งที่จะเขียนต่อตามความน่าจะเป็นทุกครั้ง
→
3. คำตอบใหม่ปรากฏในแชท
เรื่องร้องเรียนถูกปิดเพราะจ่ายเงินคืนแล้ว ตามเงื่อนไขการประนีประนอมยอมความที่บันทึกไว้ในแฟ้มคดี…
ไม่มีป้ายระดับความลับ
ลองถามโมเดลว่า “คำตอบนี้ลับแค่ไหน”
ครั้งที่ 1: ลับ ครั้งที่ 2: ใช้ภายใน ครั้งที่ 3: ลับ

เป็นการคาดเดาที่เปลี่ยนได้ทุกครั้งที่ถาม ไม่ใช่กติกาที่ใครก็ตรวจสอบได้

ในกระบวนการนี้ไม่มีขั้นตอนไหนที่คำนวณระดับความลับของคำตอบ และโมเดลทำได้แค่คาดเดา (ภาพจำลองเพื่ออธิบาย)

และบ่อยครั้งคำตอบนี้ยังสร้างความเสียหายได้มากกว่าเอกสารต้นทางแต่ละฉบับ หากตกไปอยู่ในมือคนที่ไม่ควรเห็น เพราะ AI เพิ่งดึงเฉพาะส่วนสำคัญของทุกฉบับมารวมไว้ในที่เดียว

ระดับความลับของคำตอบ ยึดตามเอกสารต้นทางที่ลับสูงสุด

การออกแบบ RAG ทั่วไป ไม่มีส่วนไหนทำเรื่องนี้ RAG จะค้นเอกสารของคุณ ส่งเนื้อหาส่วนที่ตรงกับคำถามที่สุดให้โมเดล แล้วแสดงลิงก์ แม้ในระบบที่ดัชนีค้นหารู้ Classification ของเอกสารแต่ละฉบับ และใช้มันกำหนดว่าใครค้นอะไรได้ ก็ไม่มีส่วนไหนทำให้ Classification นั้นกลายเป็นคุณสมบัติของคำตอบ

ทางแก้ไม่ใช่การมานั่งติดป้ายกำกับให้คำตอบด้วยมือ ไม่มีใครทำไหวทันกับอัตราที่โมเดลผลิตคำตอบออกมา

ทางแก้คือการทำให้ระดับความลับเดินทางไปด้วย ในเลเยอร์ข้อมูลที่มี Governance เนื้อหาที่ถูกดึงมาทุกชิ้นมี Classification ติดอยู่แล้ว และเมื่อเลเยอร์ประกอบคำตอบขึ้นมา มันจะหยิบ Classification ที่เข้มที่สุดในบรรดาทุกอย่างที่ใช้ ไม่ใช่ค่าเฉลี่ย ไม่ใช่ตัวแรก แต่คือค่าสูงสุดของสิ่งที่เข้าไปจริง ๆ

ค่านั้นถูกติดไปกับคำตอบ และแสดงให้เห็นพร้อมกับคำตอบ ย่อหน้าที่เป็นความลับเพียงย่อหน้าเดียวในสี่ย่อหน้าที่เป็นสาธารณะ ทำให้คำตอบทั้งคำตอบเป็นความลับ และมันบอกไว้อย่างนั้นบนตัวคำตอบ ตรงจุดที่คนซึ่งกำลังจะส่งต่อจะมองเห็น

นี่คือการคำนวณชุดเดียวกับที่เลเยอร์ใช้ตัดสินอยู่แล้วว่าโมเดลตัวไหนเห็นเนื้อหาได้ เพียงแต่ตรงนี้ถูกใช้เพื่อคน ไม่ใช่เพื่อเครื่อง

ระดับความลับเดียว ใช้ทั้งติดป้ายและเลือกโมเดล

เมื่อมี Infozense Knowledge Engineering แหล่งทั้งสี่เข้าสู่ฟังก์ชันเดียว ซึ่งหา Classification ที่เข้มที่สุดในบรรดาแหล่งทั้งสี่ ค่าเพียงค่าเดียวนั้นถูกนำไปใช้สองอย่าง อย่างแรก ใช้ตัดสินว่าโมเดลตัวไหนมีสิทธิ์เห็นเนื้อหานั้น อย่างที่สอง ใช้เป็นป้ายกำกับที่แสดงอยู่บนคำตอบ ทั้งสองอย่างมาจากฟังก์ชันเดียวกัน ป้ายกำกับจึงตรงกับกติกาเสมอ ไม่ว่าแหล่งที่มาจะเป็นแหล่งไหนเมื่อมี Infozense Knowledge Engineering แหล่งทั้งสี่เข้าสู่ฟังก์ชันเดียว ซึ่งหา Classification ที่เข้มที่สุดในบรรดาแหล่งทั้งสี่ ค่าเพียงค่าเดียวนั้นถูกนำไปใช้สองอย่าง อย่างแรก ใช้ตัดสินว่าโมเดลตัวไหนมีสิทธิ์เห็นเนื้อหานั้น อย่างที่สอง ใช้เป็นป้ายกำกับที่แสดงอยู่บนคำตอบ ทั้งสองอย่างมาจากฟังก์ชันเดียวกัน ป้ายกำกับจึงตรงกับกติกาเสมอ ไม่ว่าแหล่งที่มาจะเป็นแหล่งไหน
ฟังก์ชันเดียว ส่งผลให้สองปลายทาง สำหรับแหล่งที่มาทุกแหล่ง ทั้งป้ายกำกับและกติกาถูกคำนวณพร้อมกัน

ในเลเยอร์ข้อมูลที่มี Governance ระดับความลับของเอกสารต้นทางทำงานสองอย่าง

  • บอกคนว่าคำตอบลับแค่ไหน
  • ตัดสินว่าเนื้อหานั้นส่งให้โมเดลตัวไหนได้ จะเป็นโมเดลภายนอก โมเดลที่องค์กรของคุณเป็นเจ้าของหรือควบคุมเอง หรือไม่ส่งให้โมเดลไหนเลย ตามกติกาที่คุณกำหนด

ทั้งสองอย่างใช้ฟังก์ชันเดียวกัน ป้ายกำกับจึงตรงกับการตัดสินว่าโมเดลตัวไหนเห็นเนื้อหานั้นได้ ไม่ว่าแหล่งที่มาจะเป็นแหล่งไหน

มีกติกาอีกสองข้อที่ทำให้ป้ายกำกับไม่แสดงว่าคำตอบปลอดภัยกว่าแหล่งที่มาของมัน

แหล่งที่ไม่มี Classification จะแสดงเป็นระดับ Restricted เสมอ ไม่ใช่ระดับสาธารณะ ถ้าเนื้อหาที่อยู่เบื้องหลังคำตอบไม่มี Classification ติดมาเลย เลเยอร์จะไม่ถือว่าการไม่มีนั้นคือการอนุญาต แต่จะกำกับคำตอบนั้นไว้ที่ระดับความลับสูงสุดเท่าที่เป็นไปได้ ช่องว่างใน Metadata ของคุณทำให้คำเตือนดังขึ้น ไม่ใช่เบาลง

ป้ายกำกับอธิบายตัวเนื้อหา ไม่ได้อธิบายตัวผู้อ่าน มันไม่ได้บอกว่าคนคนนั้นได้รับอนุญาตให้เห็นสิ่งนี้หรือไม่ เพราะมีอย่างอื่นตัดสินไปแล้วก่อนการดึงข้อมูล สิ่งที่มันบอกคือตอนนี้เขากำลังถืออะไรอยู่ ซึ่งเป็นคำถามที่เขากำลังจะตอบด้วยวิจารณญาณของตัวเอง ตอนตัดสินใจว่าจะเอาไปวางไว้ที่ไหน

ขีดจำกัดที่เราพูดตรง ๆ

เมื่อคำตอบนั้นออกจากหน้าจอไปแล้ว ป้ายกำกับไม่ได้ตามไปด้วย ถ้าคัดลอกข้อความไปวางในอีเมล สิ่งที่คุณคัดลอกไปก็คือข้อความเท่านั้น

เรื่องนี้ต้องพูดตรง ๆ ไม่มีระบบไหนรับประกันได้ว่าข้อความจะไม่ถูกคัดลอกออกไป สิ่งที่เลเยอร์ทำได้คือ บอกคนที่กำลังจะคัดลอกให้รู้ว่าข้อความนั้นลับแค่ไหน ถ้าเขารู้แล้วยังส่งต่อ นั่นเป็นการตัดสินใจของเขาเอง แต่ถ้าไม่มีใครบอกเขา การรั่วไหลก็เกิดขึ้นโดยไม่มีใครตั้งใจ ความต่างนี้คือสิ่งที่ผู้ตรวจสอบจะถามในภายหลัง

ข้อสรุป

การอ้างอิงตอบคำถามที่ทีมของคุณถามตอนสร้างผู้ช่วย AI นั่นคือ สิ่งนี้มาจากไหน แต่ไม่ได้ตอบคำถามที่เจ้าหน้าที่กำกับการปฏิบัติตามกฎเกณฑ์ของคุณกำลังถามอยู่ตอนนี้ นั่นคือ เรากำลังถืออะไรอยู่ในมือ

คำตอบจาก AI คือข้อความใหม่ที่ต้องมีการติดป้ายกำกับ ถ้าไม่มีป้ายกำกับ มันจะเดินทางไปทั่วองค์กรของคุณโดยดูไร้พิษภัยเหมือนข้อความแชททั่วไป ทั้งที่แบกเนื้อหาจากเอกสารต้นทางฉบับที่มีระดับความลับสูงที่สุดมาด้วย แต่ถ้ามีป้ายกำกับ มันก็เป็นแค่เอกสารชั้นความลับอีกฉบับหนึ่ง ซึ่งคนของคุณรู้อยู่แล้วว่าต้องทำอย่างไรกับเอกสารแบบนั้น

คุณไม่ได้สร้างมัน คุณแค่ตั้งค่ามัน

คุณไม่ต้องเขียนกติกานี้เอง และไม่ต้องดูแลกระบวนการติดป้ายกำกับชุดที่สองสำหรับคำตอบ Infozense Knowledge Engineering ส่งมอบเลเยอร์ข้อมูลที่มี Governance พร้อม Output Gate ติดตั้งไว้แล้ว แหล่งข้อมูลทุกแหล่งมี Classification ติดอยู่ คำตอบทุกคำตอบรับค่าที่เข้มที่สุดที่มีอยู่ เนื้อหาที่ไม่มี Classification ถูกนับเป็นระดับความลับสูงสุด และค่าที่คนของคุณเห็นคือค่าเดียวกับที่เลเยอร์ใช้บังคับ คุณกำหนด Classification ให้ความรู้ของคุณครั้งเดียว จากนั้นคำตอบจะติดป้ายกำกับให้ตัวเองไปเอง

Infozense Knowledge Engineering

คนของคุณส่งต่อคำตอบจาก AI ลงอีเมลและแชทอยู่หรือเปล่า?

นี่คือเรื่องที่เราถนัดที่สุด เพียงนำ Workspace จริงมาหนึ่งชุด แล้วเราจะไล่ดูไปด้วยกันว่าคำตอบเหล่านั้นแบกอะไรอยู่บ้าง

คุยกับเรา →

contact@infozense.com  |  +66-82-242-4008  |  Bangkok, Thailand