LSD KBM · Nền tảng tri thức RAG doanh nghiệp Mới

Chuẩn hoá tài liệu ngân hàng thành tri thức truy xuất được.

KBM nạp, chuẩn hoá và truy xuất tài liệu — kể cả PDF quét, văn bản tiếng Việt lỗi phông và trang chứa hình ảnh — qua quy trình có kiểm soát chất lượng và phân quyền truy cập chặt chẽ.

  • Docling + VLM
  • MinIO WORM
  • Qdrant · OpenSearch · RRF
  • On-prem
kbm · ingestion
  1. Tài liệu đầu vàoHợp đồng tín dụng · PDF quét
  2. Lưu trữMinIO WORM · content-addressed
  3. Bóc tách & OCRDocling + VLM · detect-gate từng trang
  4. Kiểm soát chất lượngL1 rules + L2 LLM-judge98 · sẵn sàng
  5. Chỉ mục & truy xuấtQdrant · OpenSearch · RRF · ACLhybrid

Vấn đề

Chất lượng dữ liệu quyết định chất lượng câu trả lời

Tài liệu ngân hàng thường là bản quét, tiếng Việt lỗi phông, bảng phức tạp và nhiều hình ảnh. Những lỗi phổ biến dưới đây làm suy giảm chất lượng truy xuất.

Lỗi phông tiếng Việt

Bộ phân tích thô làm sai ký tự có dấu, dẫn tới câu trả lời sai lệch.

Mất mát hình ảnh & bảng

Hình, biểu đồ và bảng gộp ô bị bỏ qua khi trích xuất, làm mất ngữ cảnh.

Thiếu phân quyền truy cập

Người dùng có thể truy xuất tài liệu ngoài phạm vi được phép.

Thiếu kiểm soát chất lượng

Tài liệu chất lượng thấp được đưa vào chỉ mục mà không qua đánh giá.

Năng lực

Nạp, chuẩn hoá và truy xuất — có kiểm soát toàn trình

01

Nạp dữ liệu có kiểm soát

Cấu hình OCR/VLM theo từng loại tài liệu, theo dõi tiến trình từng trang kèm chi phí token. File lưu vào MinIO (WORM, content-addressed) qua outbox giao dịch — idempotent.

02

Cleaning Desk

Đối chiếu bản gốc và bản markdown, đánh dấu vùng ảnh/bảng và hiệu chỉnh với gợi ý từ mô hình trước khi phát hành.

03

Knowledge Core

Phân đoạn theo cấu trúc tài liệu; truy xuất kết hợp Qdrant (dense) + OpenSearch (BM25) với RRF, xếp hạng lại và Hit-Test để kiểm chứng trước khi vận hành.

04

Phân quyền & ACL

Đồng bộ quyền từ SharePoint/Graph, đối soát và truy xuất mặc định từ chối theo danh tính người dùng. Thông tin xác thực mã hoá AES-256-GCM.

Hành trình một tài liệu

Từ file thô đến câu trả lời có nguồn

  1. 1

    Nạp

    Tải → MinIO WORM

  2. 2

    Bóc tách

    Docling + VLM-OCR

  3. 3

    Chuẩn hoá

    Rà soát & chấm điểm

  4. 4

    Chỉ mục

    Phân đoạn + vector hoá

  5. 5

    Truy xuất

    Hybrid RRF + rerank, theo ACL

Ứng dụng thực tế

Màn hình thực tế trên môi trường UAT

Ảnh chụp trực tiếp từ môi trường UAT. Bấm vào từng màn hình để xem chi tiết.

Khác biệt

Ngang tầm các nền tảng lớn, với chủ quyền dữ liệu nội bộ

5định dạng tài liệu (PDF · DOCX · XLSX · PPTX · ảnh)
3chế độ truy xuất (vector · từ khoá · kết hợp)
2lớp kiểm soát chất lượng
100%kết quả truy xuất theo ACL
Tiêu chíLSD KBMNền tảng cloud phổ biến
Tách vùng ảnh / bảng khi nạpCóCó
OCR tối ưu tiếng ViệtChuyên biệt (VLM qua model-gateway)Tổng quát
Object store WORM + lineageMinIO content-addressedS3/GCS (cloud)
Kiểm soát chất lượng trước khi phục vụHai lớp (rules + LLM-judge)Hạn chế
Hybrid retrievalQdrant + OpenSearch + RRF + rerankCó
Chủ quyền dữ liệuNội bộ (on-prem)Cloud
Tích hợp trực tiếp AI AgentCó (LSD AgentForge)Tuỳ hệ

KBM là phân hệ tri thức của LSD AgentForge — dùng độc lập, hoặc làm lớp RAG cho AI Agent.

LSD KBM

Kho tri thức chất lượng cao cho trợ lý AI của bạn

Đặt lịch Discovery Workshop để đánh giá kho tài liệu hiện có và thử nghiệm truy xuất trên dữ liệu của bạn.

  • Triển khai on-prem, dữ liệu không rời hệ thống
  • OCR tối ưu tiếng Việt cho tài liệu quét
  • Tích hợp trực tiếp với LSD AgentForge

Thông tin của bạn chỉ được dùng để phản hồi yêu cầu này.