Bỏ qua để đến nội dung

5.5 Human Review & Confidence Calibration

Human review là lưới an toàn cho các hệ thống trích xuất và phân loại tự động. Đề thi kiểm tra bạn hiểu khi nào và dùng reviewer thế nào cho hiệu quả. Thách thức cốt lõi không phải có dùng human review hay không, mà là phân bổ năng lực reviewer hữu hạn sao cho độ chính xác cao nhất với chi phí thấp nhất. Muốn vậy phải hiểu confidence calibration, bẫy aggregate metrics, và các chiến lược stratified sampling.

Đây là ngộ nhận nguy hiểm nhất trong hệ thống trích xuất chạy production. Hệ thống báo 97% độ chính xác tổng thể. Cả đội ăn mừng. Quản lý duyệt tự động hoá toàn bộ phần trích xuất có confidence cao.

Vấn đề: con số 97% đó che giấu tỉ lệ hỏng thảm hoạ ở một số loại tài liệu. Hệ thống trích xuất ngày tháng từ hoá đơn chuẩn đạt 99.5%. Nhưng biên nhận viết tay? 60%. PDF scan với OCR kém? 72%. Tài liệu quốc tế định dạng phi chuẩn? 45%.

Con số tổng che mất đúng những phân khúc hệ thống hỏng nặng nhất. Mà đó thường là những phân khúc mà lỗi gây tác động kinh doanh lớn nhất — biên nhận viết tay từ nhân viên hiện trường, hoá đơn quốc tế từ nhà cung cấp mới, tài liệu cũ đã scan phục vụ audit tuân thủ.

Quy tắc: luôn kiểm chứng độ chính xác theo loại tài liệu VÀ theo từng field trước khi tự động hoá. Đừng bao giờ ra quyết định tự động hoá chỉ dựa trên aggregate metrics.

Loại tài liệu Độ chính xác ngày Độ chính xác số tiền Độ chính xác tên
Hoá đơn chuẩn 99.5% 98.2% 97.8%
Biên nhận viết tay 60.1% 55.3% 71.2%
PDF scan 72.4% 69.8% 80.1%
Định dạng quốc tế 45.2% 52.1% 63.4%
Tổng thể 97.0% 96.1% 95.8%

Con số tổng trông rất đẹp vì hoá đơn chuẩn chiếm phần lớn khối lượng. Nhưng ba loại tài liệu có độ chính xác không chấp nhận được, bị che bởi trung bình có trọng số theo khối lượng.

Ngay cả sau khi đã kiểm chứng theo loại tài liệu và theo field, bạn vẫn cần xác minh liên tục. Stratified random sampling nghĩa là chọn mẫu đại diện từ mỗi stratum (loại tài liệu, dải confidence, loại field) rồi cho người thật kiểm tra.

Điểm mấu chốt là bạn phải lấy mẫu cả phần trích xuất có confidence cao, không chỉ phần confidence thấp. Các item confidence thấp vốn đã được chuyển sang human review. Các item confidence cao thì chạy tự động. Nếu model phát sinh một kiểu lỗi mới ảnh hưởng tới phần confidence cao thì chỉ stratified sampling mới bắt được.

Stratified sampling phục vụ hai mục đích:

  1. Đo độ chính xác liên tục — xác nhận mỗi phân khúc vẫn giữ được mức chính xác đã kiểm chứng.
  2. Phát hiện kiểu lỗi mới — tìm ra các kiểu hỏng chưa từng có trong tập kiểm chứng ban đầu.

Không có stratified sampling thì bạn đang bay mù với phần trích xuất tự động. Hệ thống có thể phát sinh lỗi hệ thống trên một định dạng tài liệu mới, và bạn sẽ không biết cho tới khi quy trình kinh doanh phía sau đổ vỡ.

Model có thể xuất ra confidence score cho từng field. Với một lần trích xuất hoá đơn, nó có thể báo:

{
"vendorName": {"value": "Acme Corp", "confidence": 0.98},
"invoiceDate": {"value": "2024-03-15", "confidence": 0.95},
"totalAmount": {"value": "$1,247.83", "confidence": 0.72},
"lineItems": {"value": [...], "confidence": 0.61}
}

Nhưng confidence score thô của model thì chưa được calibrate. Một model báo confidence 0.95 có thể thực tế chỉ đúng 88% trên một số loại field. Hoặc đúng 99% trên loại khác. Confidence score là tương đối, không phải tuyệt đối.

Calibration cần tập validation có gán nhãn (ground truth data). Bạn lấy một tập tài liệu đã biết kết quả trích xuất đúng, chạy model, so confidence score với độ chính xác thực tế, rồi dựng đường calibration. Nó cho bạn biết: “Khi model báo confidence 0.90 trên field ngày tháng, thực tế nó đúng 94% số lần. Khi nó báo 0.90 trên field số tiền, thực tế chỉ đúng 82%.”

Ngưỡng đã calibrate rồi mới dùng để định tuyến:

  • Field trên ngưỡng đã calibrate → tự động (kèm stratified sampling)
  • Field dưới ngưỡng đã calibrate → human review
  • Field nằm trong vùng mơ hồ → human review ưu tiên

Reviewer là người thật, tốn kém và hữu hạn. Đề thi kiểm tra xem bạn có biết phân bổ năng lực của họ cho hiệu quả không.

Đưa các item bất định nhất tới reviewer trước. Nghĩa là:

  • Các field có confidence model thấp
  • Phần trích xuất từ tài liệu nguồn mơ hồ hoặc mâu thuẫn
  • Các loại tài liệu vốn có lịch sử chính xác kém
  • Các field mà model thể hiện sự bất định (ví dụ có nhiều cách hiểu khả dĩ)

KHÔNG rải đều năng lực reviewer cho toàn bộ phần trích xuất. Phân bổ đều làm phí thời gian review các item confidence cao mà model vốn làm tốt, đồng thời để lại không đủ năng lực cho những item bất định thực sự cần con người phán đoán.

Việc ưu tiên phải động, không tĩnh. Khi hệ thống xử lý tài liệu, hàng đợi chờ review cần được sắp theo mức độ bất định. Reviewer xong một item thì item kế tiếp trong hàng đợi của họ phải là item bất định nhất còn lại, chứ không phải item tiếp theo theo thứ tự thời gian.

Thứ tự rất quan trọng:

  1. Đo độ chính xác theo loại tài liệu và theo từng field — không dùng con số tổng.
  2. Calibrate confidence score bằng tập validation có gán nhãn.
  3. Đặt ngưỡng đã calibrate cho ranh giới tự động hoá và human review.
  4. Triển khai stratified random sampling để xác minh liên tục phần trích xuất tự động.
  5. Chỉ khi đó mới giảm human review ở những phân khúc chứng minh được độ chính xác ổn định, đã kiểm chứng.

Nhảy thẳng tới bước 5 dựa trên aggregate metrics chính là cái bẫy. Mỗi bước trong chuỗi này tồn tại để chặn một kiểu hỏng cụ thể.

Một hệ thống trích xuất dữ liệu có cấu trúc đạt 97% độ chính xác tổng thể trên mọi loại tài liệu. Đội đề xuất tự động hoá toàn bộ phần trích xuất có confidence model trên 95% để giảm chi phí human review. Rủi ro then chốt của hướng này là gì?

  • A. Ngưỡng confidence 95% là quá thấp cho tự động hoá và nên nâng lên 99% trước khi cho phép bất kỳ phần trích xuất nào bỏ qua human review
  • B. Độ chính xác tổng thể có thể che mất hiệu năng kém ở một số loại tài liệu hoặc một số field, và confidence score cần được calibrate bằng tập validation có gán nhãn trước khi dùng
  • C. Model sẽ tự tin quá mức theo thời gian khi xử lý thêm nhiều tài liệu, nên hệ thống sẽ cần retrain định kỳ để giữ được calibration
  • D. Phần trích xuất tự động luôn phải có human review bất kể confidence score, nên đề xuất này sai từ gốc dù đặt ngưỡng ở đâu
Đáp án & giải thích

Đúng: B

  • A — Giá trị ngưỡng không phải vấn đề cốt lõi — vấn đề là aggregate metrics che mất chênh lệch hiệu năng giữa các loại, dù ngưỡng đặt ở đâu đi nữa.
  • B — 97% tổng thể có thể che giấu tỉ lệ lỗi 40% ở một số loại tài liệu. Không có kiểm chứng phân tầng và confidence calibration, tự động hoá sẽ hỏng âm thầm trên một số input.
  • C — LLM không học thêm trong lúc inference. Vấn đề là khoảng trống calibration sẵn có giữa các loại tài liệu, không phải model drift.
  • D — Tự động hoá là hợp lệ khi đã kiểm chứng đúng theo loại tài liệu và theo field. Vấn đề nằm ở việc ra quyết định dựa trên aggregate metrics chưa calibrate, không phải ở bản thân khái niệm tự động hoá.

Năm câu trắc nghiệm theo format đề thi về Human Review & Confidence Calibration. Chọn đáp án trước, rồi mở phần giải thích.

Một hệ thống trích xuất dữ liệu có cấu trúc đạt 97% độ chính xác tổng thể trên mọi loại tài liệu. Đội đề xuất tự động hoá toàn bộ phần trích xuất có confidence model trên 95% để giảm chi phí human review. Rủi ro then chốt là gì?

  • A. Ngưỡng confidence 95% là quá thấp và nên nâng lên 99% cho tự động hoá
  • B. Model sẽ tự tin quá mức theo thời gian khi xử lý thêm tài liệu, nên cần retrain định kỳ
  • C. Độ chính xác tổng thể có thể che mất hiệu năng kém ở từng loại tài liệu và ở từng field
  • D. Phần trích xuất tự động luôn phải có human review bất kể confidence, nên đề xuất này sai từ gốc
Đáp án & giải thích

Đúng: C

  • A sai vì: giá trị ngưỡng không phải vấn đề cốt lõi. Aggregate metrics che mất chênh lệch giữa các loại dù ngưỡng đặt ở đâu.
  • B sai vì: LLM không học thêm trong lúc inference. Vấn đề là khoảng trống calibration sẵn có giữa các loại tài liệu, không phải model drift.
  • C đúng vì: 97% tổng thể có thể che giấu tỉ lệ lỗi 40% ở một số loại tài liệu. Không kiểm chứng phân tầng theo loại và theo field, không calibrate confidence bằng tập validation có gán nhãn, thì tự động hoá sẽ hỏng âm thầm trên một số input.
  • D sai vì: tự động hoá là hợp lệ khi đã kiểm chứng đúng theo loại tài liệu và theo field. Vấn đề là ra quyết định dựa trên aggregate metrics chưa calibrate.

Một đội triển khai hệ thống review: mọi phần trích xuất có confidence dưới 0.80 được chuyển cho reviewer. Trên 0.80 thì tự động hoàn toàn. Cách làm này thiếu gì?

  • A. Ngưỡng 0.80 quá thấp và nên nâng lên 0.95
  • B. Human review cho toàn bộ phần trích xuất bất kể confidence trong tháng đầu
  • C. Một model thứ hai để kiểm chứng kết quả của model thứ nhất trước khi tự động hoá
  • D. Stratified random sampling trên phần trích xuất confidence cao để bắt lỗi kiểu mới
Đáp án & giải thích

Đúng: D

  • A sai vì: nâng ngưỡng không chạm tới điểm mù. Không lấy mẫu phần đã tự động thì mọi kiểu lỗi mới ở item confidence cao đều lọt lưới.
  • B sai vì: review một tháng rồi thôi thì không có khả năng phát hiện liên tục. Kiểu lỗi mới có thể xuất hiện bất cứ lúc nào.
  • C sai vì: thêm model thứ hai làm tăng chi phí và độ phức tạp mà không giải quyết nhu cầu cốt lõi là con người xác minh liên tục phần output tự động.
  • D đúng vì: item confidence cao chạy tự động và không được review. Nếu model phát sinh lỗi hệ thống ảnh hưởng phần confidence cao trên một số loại tài liệu thì chỉ stratified sampling mới bắt được. Item confidence thấp vốn đã được review.

Model báo confidence 0.92 khi trích ngày từ một hoá đơn chuẩn, và cũng 0.92 khi trích ngày từ một biên nhận viết tay. Hai trường hợp này có nên xử lý như nhau không?

  • A. Không, confidence thô chưa calibrate và chênh lệch nhiều theo loại tài liệu
  • B. Có, cùng confidence score nghĩa là cùng độ tin cậy bất kể loại tài liệu
  • C. Có, nhưng chỉ khi cả hai loại tài liệu đều có trong dữ liệu huấn luyện
  • D. Không, biên nhận viết tay luôn phải đưa cho human review bất kể confidence
Đáp án & giải thích

Đúng: A

  • A đúng vì: confidence score phải được calibrate bằng tập validation có gán nhãn. Đường calibration nhiều khả năng sẽ cho thấy 0.92 trên hoá đơn chuẩn đáng tin hơn hẳn 0.92 trên biên nhận viết tay.
  • B sai vì: confidence thô của model chưa được calibrate. Cùng một con số mang ý nghĩa khác nhau với từng tổ hợp tài liệu–field.
  • C sai vì: có mặt trong dữ liệu huấn luyện không đảm bảo confidence đã calibrate. Luôn phải calibrate đối chiếu ground truth.
  • D sai vì: biên nhận viết tay nhìn chung có thể cần review nhiều hơn, nhưng cách đúng là dùng ngưỡng đã calibrate chứ không phải quy tắc cứng vơ đũa cả nắm.

Một đội review có 5 reviewer xử lý 500 phần trích xuất mỗi ngày. Hiện tại item được giao theo thứ tự thời gian. Nên cấu trúc lại hàng đợi thế nào?

  • A. Giao item ngẫu nhiên để phân bổ công bằng giữa các loại tài liệu
  • B. Sắp hàng đợi theo mức bất định để mỗi reviewer luôn nhận item bất định nhất còn lại
  • C. Giao theo loại tài liệu để mỗi reviewer chuyên một loại
  • D. Chia đều item cho các reviewer để cân bằng khối lượng công việc
Đáp án & giải thích

Đúng: B

  • A sai vì: giao ngẫu nhiên làm phí thời gian reviewer vào các item confidence cao vốn không cần con người phán đoán.
  • B đúng vì: ưu tiên theo mức bất định đảm bảo năng lực reviewer hữu hạn được dùng ở nơi tạo giá trị lớn nhất. Reviewer xong một item thì item kế tiếp phải là item bất định nhất còn lại.
  • C sai vì: chuyên môn hoá có thể giúp độ chính xác nhưng không giải quyết bài toán ưu tiên: item nào cần review gấp nhất.
  • D sai vì: chia đều thực chất vẫn là theo thứ tự thời gian, chỉ thêm vài bước. Nó vẫn phí năng lực vào các item confidence cao.

Thứ tự đúng để giảm human review trên phần trích xuất tự động là gì?

  • A. Đo độ chính xác tổng thể -> Đặt ngưỡng confidence -> Tự động hoá phần trên ngưỡng -> Thỉnh thoảng lấy mẫu
  • B. Bắt đầu tự động hoàn toàn -> Chỉ thêm human review cho những field lộ lỗi trong production
  • C. Chạy hệ thống 30 ngày -> Tính tỉ lệ lỗi -> Tự động hoá nếu tỉ lệ lỗi chấp nhận được
  • D. Đo theo loại và theo field, calibrate, đặt ngưỡng, lấy mẫu, rồi mới giảm review
Đáp án & giải thích

Đúng: D

  • A sai vì: dùng độ chính xác tổng thể (chính là cái bẫy) và ngưỡng chưa calibrate. Lấy mẫu thỉnh thoảng là không đủ.
  • B sai vì: tự động hoàn toàn trước khi kiểm chứng thì chắc chắn có lỗi không ai phát hiện. Review phải đi trước tự động hoá, không phải sau.
  • C sai vì: 30 ngày với aggregate metrics không lộ ra vấn đề theo từng loại. Kiểu lỗi mới có thể xuất hiện sau 30 ngày.
  • D đúng vì: mỗi bước chặn một kiểu hỏng cụ thể: đo theo từng loại chặn bẫy aggregate, calibration chặn ngưỡng không đáng tin, stratified sampling cho xác minh liên tục, và chỉ những phân khúc đã kiểm chứng mới được giảm review.