5.6 Information Provenance & Multi-Source Synthesis
Những gì cần nắm
Phần tiêu đề “Những gì cần nắm”Information provenance — biết mỗi khẳng định đến từ đâu và nên tin tới mức nào — là ranh giới giữa một hệ thống nghiên cứu cho ra output đáng tin và một hệ thống cho ra thứ nghe có vẻ hợp lý nhưng là bịa. Đề thi kiểm tra bạn hiểu attribution sống sót (hay chết) ra sao qua pipeline tổng hợp multi-agent, cách xử lý nguồn mâu thuẫn, và vì sao bối cảnh thời gian ngăn được những mâu thuẫn giả.
Claim-source mapping có cấu trúc
Phần tiêu đề “Claim-source mapping có cấu trúc”Mọi finding trong hệ thống nghiên cứu multi-agent phải mang theo provenance của nó. Đây không phải metadata tuỳ chọn. Đó là bảo đảm về mặt cấu trúc rằng output cuối truy ngược được về nguồn cụ thể. Mỗi finding phải có:
- Claim: khẳng định cụ thể đang được đưa ra
- Source URL: nơi tìm thấy thông tin
- Document name: tiêu đề tài liệu nguồn
- Relevant excerpt: đoạn trích cụ thể chống lưng cho khẳng định
- Publication date: thời điểm nguồn được công bố hoặc dữ liệu được thu thập
{ "claim": "Global renewable energy investment reached $495 billion in 2023", "sourceUrl": "https://example.com/iea-report-2024", "documentName": "IEA World Energy Investment Report 2024", "relevantExcerpt": "Total investment in renewable energy technologies reached approximately $495 billion in calendar year 2023, representing a 17% increase over 2022.", "publicationDate": "2024-06-15"}Thách thức then chốt là attribution chết trong lúc summarisation. Khi synthesis agent gộp findings từ nhiều subagent, nó tự nhiên sẽ nén và diễn đạt lại. Không có chỉ dẫn tường minh về việc giữ claim-source mapping, bản tổng hợp sẽ đẻ ra những câu kiểu “Đầu tư vào năng lượng tái tạo đã tăng đáng kể” — không số liệu, không nguồn, không ngày.
Agent tuyến dưới phải giữ và merge claim-source mapping một cách tường minh qua bước tổng hợp. Việc này đòi hỏi:
- Subagent xuất findings theo đúng format claim-source có cấu trúc.
- Synthesis agent được yêu cầu giữ các mapping đó khi gộp findings.
- Output cuối có citation nội dòng hoặc một mục tham chiếu có cấu trúc, truy ngược từng khẳng định về nguồn của nó.
Xử lý xung đột
Phần tiêu đề “Xử lý xung đột”Khi hai nguồn đáng tin báo hai con số khác nhau cho cùng một chỉ số, synthesis agent đứng trước một quyết định quan trọng. Cách làm sai — và cũng là thứ đề thi nhắm tới — là tuỳ tiện chọn lấy một giá trị.
Ví dụ: Source A báo tăng trưởng thị trường 12%. Source B báo 8%. Cả hai đều là ấn phẩm đáng tin.
Cách sai: chọn nguồn mới hơn, hoặc lấy trung bình, hoặc chọn nguồn của nhà xuất bản uy tín hơn.
Cách đúng: ghi chú cả hai giá trị kèm attribution đầy đủ. Để người đọc tự quyết.
Market growth estimates vary by source:- **12% growth** — IEA World Energy Report (published June 2024, using 2023 calendar year data)- **8% growth** — Bloomberg NEF Annual Review (published March 2024, using July 2022–June 2023 data)
The difference may reflect different reporting periods and methodological approaches.Cách này giữ lại toàn cảnh. Người đọc thấy cả hai con số, hiểu nguồn gốc, và tự đánh giá con số nào phù hợp với nhu cầu của họ. Tuỳ tiện chọn một giá trị là phá hủy thông tin và tạo ra cảm giác chắc chắn giả.
Temporal awareness
Phần tiêu đề “Temporal awareness”Ngày công bố khác nhau giải thích được con số khác nhau. Đó không phải mâu thuẫn. Đó là bối cảnh thời gian, và nó phải được giữ lại.
Xét hai nguồn:
- Source A (công bố 2023): báo tăng trưởng 8%
- Source B (công bố 2024): báo tăng trưởng 12%
Không có ngày công bố, hai con số trông như mâu thuẫn. Có ngày, chúng kể một câu chuyện: tăng trưởng đã tăng tốc từ 8% lên 12% trong kỳ đo. “Xung đột” thực ra là một xu hướng.
Bắt buộc có ngày công bố/ngày thu thập dữ liệu trong mọi output có cấu trúc. Đây không phải chuyện dọn dẹp cho gọn; đó là thứ làm cho việc diễn giải đúng trở nên khả thi. Thiếu bối cảnh thời gian, các xu hướng hợp lệ bị hiểu nhầm thành vấn đề chất lượng dữ liệu, và synthesis agent có thể gắn cờ hoặc dập đi những findings thực ra hoàn toàn nhất quán.
Subagent phải đưa những ngày này vào output có cấu trúc của mình. Synthesis agent phải giữ chúng qua quá trình merge. Và output cuối phải trình bày chúng cạnh dữ liệu mà chúng mô tả.
Trình bày theo đúng loại nội dung
Phần tiêu đề “Trình bày theo đúng loại nội dung”Mỗi loại nội dung đòi một định dạng trình bày khác nhau. Đề thi kiểm tra xem bạn có hiểu rằng việc tổng hợp không nên ép mọi thứ về một format đồng nhất hay không:
Dữ liệu tài chính → bảng. Con số, so sánh và xu hướng dễ đọc nhất ở dạng bảng. Ép dữ liệu tài chính vào đoạn văn xuôi khiến việc so sánh giá trị và nhận ra quy luật khó hơn hẳn.
| Năm | Đầu tư ($B) | Tăng trưởng (%) |
|---|---|---|
| 2021 | 366 | 12% |
| 2022 | 423 | 16% |
| 2023 | 495 | 17% |
Tin tức và sự kiện thời sự → văn xuôi. Bối cảnh tường thuật, quan hệ nhân quả và diễn biến theo thời gian đọc tự nhiên nhất ở dạng đoạn văn.
Phát hiện kỹ thuật → danh sách có cấu trúc. Pattern kiến trúc, đặc tả API và các tuỳ chọn cấu hình rõ ràng nhất ở dạng gạch đầu dòng hoặc đánh số, có phân cấp rõ.
Ép mọi nội dung vào một format duy nhất — toàn bảng, hoặc toàn văn xuôi, hoặc toàn danh sách — làm giảm khả năng đọc và tiếp thu. Synthesis agent nên chọn định dạng trình bày phù hợp với loại nội dung.
Giữ attribution qua tổng hợp nhiều bước
Phần tiêu đề “Giữ attribution qua tổng hợp nhiều bước”Trong pipeline multi-agent, attribution phải sống sót qua từng bước:
- Research subagent thu thập findings kèm claim-source mapping.
- Analysis subagent đánh giá findings và thêm nhận định, vẫn giữ mapping gốc.
- Synthesis subagent gộp findings từ nhiều agent, merge các mapping.
- Report generation tạo output cuối kèm citation nội dòng.
Ở mỗi bước đều có rủi ro mất attribution. Điểm hỏng phổ biến nhất là bước 3, nơi synthesis agent gộp và diễn đạt lại findings mà không mang theo source mapping. Prompt của synthesis agent phải yêu cầu rõ ràng rằng mọi khẳng định trong output của nó đều truy ngược được về một nguồn cụ thể.
Báo cáo nên có các mục riêng phân biệt findings đã vững chắc với findings còn tranh cãi, giữ lại cách diễn đạt của nguồn gốc và bối cảnh phương pháp. Một finding được ba nguồn độc lập chống lưng khác hẳn một finding dựa trên một báo cáo duy nhất, kể cả khi cả hai được viết ra với độ chắc chắn ngang nhau.
Hoàn tất phân tích mà vẫn giữ nguyên xung đột
Phần tiêu đề “Hoàn tất phân tích mà vẫn giữ nguyên xung đột”Khi phân tích tài liệu gặp các giá trị mâu thuẫn, analysis agent phải hoàn tất công việc với xung đột được giữ nguyên và ghi chú tường minh. Nó không được tự giải quyết xung đột — quyết định đó thuộc về coordinator hoặc người đọc.
{ "field": "annualRevenue", "conflictDetected": true, "values": [ { "value": "$4.2M", "source": "Annual Report 2023", "context": "Audited financial statements, fiscal year ending December 2023" }, { "value": "$3.8M", "source": "SEC Filing Q4 2023", "context": "Preliminary unaudited figures, calendar year 2023" } ], "possibleExplanation": "Difference may reflect audited vs preliminary figures and fiscal vs calendar year reporting periods"}Coordinator sau đó tự quyết cách xử lý xung đột: trình bày cả hai giá trị, điều tra thêm, hoặc escalate cho chuyên viên phân tích là người thật.
Bẫy thi
Phần tiêu đề “Bẫy thi”Tình huống luyện tập
Phần tiêu đề “Tình huống luyện tập”Một hệ thống nghiên cứu multi-agent tạo báo cáo tổng hợp về xu hướng thị trường. Hai nguồn đáng tin báo hai mức tăng trưởng khác nhau: Source A báo 12% (dữ liệu 2023) và Source B báo 8% (dữ liệu 2024). Synthesis agent hiện đang chọn giá trị mới hơn. Cách đúng là gì?
- A. Luôn dùng nguồn mới nhất, vì ngày công bố muộn hơn khiến nó phản ánh đúng hơn tình hình thị trường hiện tại
- B. Lấy trung bình hai giá trị và báo tăng trưởng 10%, kèm chú thích ghi lại độ chênh giữa hai nguồn
- C. Ghi chú cả hai giá trị kèm attribution và ngày công bố, để người đọc tự quyết cách diễn giải chênh lệch
- D. Gắn cờ xung đột và escalate cho một nhà nghiên cứu là người thật xử lý trước khi đưa bất kỳ con số nào vào báo cáo cuối
Đáp án & giải thích
Đúng: C
- A — Cách này âm thầm vứt bỏ bối cảnh lịch sử hợp lệ. Chênh lệch có thể phản ánh một xu hướng thật là tăng trưởng đang tăng tốc, không phải vấn đề chất lượng dữ liệu.
- B — Lấy trung bình các số liệu mâu thuẫn là sai về mặt toán học và phá hủy bối cảnh thời gian vốn giải thích được chênh lệch giữa hai giá trị.
- C — Cách này giữ được provenance, bối cảnh thời gian và cả hai điểm dữ liệu. Người đọc thấy được ngày khác nhau giải thích con số khác nhau và tự diễn giải.
- D — Không cần thiết — hai giá trị không hề mâu thuẫn khi xét bối cảnh thời gian. Ghi chú đầy đủ kèm ngày là đủ để gỡ chỗ mơ hồ này.
Nguồn
Phần tiêu đề “Nguồn”- Claude Certified Architect Foundations Exam Guide — Domain 5, Task Statement 5.6 — Anthropic
- Anthropic Multi-Agent Research Patterns — Anthropic
- Anthropic Prompt Engineering — Citation and Attribution — Anthropic
Exam Simulator
Phần tiêu đề “Exam Simulator”Năm câu trắc nghiệm theo format đề thi về Information Provenance & Multi-Source Synthesis. Chọn đáp án trước, rồi mở phần giải thích.
Câu 1
Phần tiêu đề “Câu 1”Một hệ thống nghiên cứu multi-agent tạo báo cáo tổng hợp về xu hướng thị trường. Hai nguồn đáng tin báo hai mức tăng trưởng khác nhau: Source A báo 12% (dữ liệu 2023) và Source B báo 8% (dữ liệu 2024). Synthesis agent hiện đang chọn giá trị mới hơn. Cách đúng là gì?
- A. Luôn dùng nguồn mới nhất vì nó phản ánh dữ liệu cập nhật nhất
- B. Ghi chú cả hai giá trị kèm nguồn và ngày công bố đầy đủ
- C. Lấy trung bình hai giá trị và báo tăng trưởng 10% kèm ghi chú về độ chênh giữa các nguồn
- D. Gắn cờ xung đột và escalate cho nhà nghiên cứu là người thật xử lý trước khi đưa vào báo cáo
Đáp án & giải thích
Đúng: B
- A sai vì: âm thầm vứt bỏ bối cảnh lịch sử hợp lệ. Chênh lệch có thể phản ánh một xu hướng thật (tăng trưởng chậm lại), không phải vấn đề chất lượng dữ liệu.
- B đúng vì: giữ được provenance, bối cảnh thời gian và cả hai điểm dữ liệu. Người đọc thấy được ngày khác nhau giải thích con số khác nhau và tự diễn giải.
- C sai vì: lấy trung bình các số liệu mâu thuẫn là sai về mặt toán học và phá hủy bối cảnh thời gian vốn giải thích được chênh lệch.
- D sai vì: escalate không cần thiết — hai giá trị không mâu thuẫn khi xét bối cảnh thời gian. Ghi chú đầy đủ kèm ngày là đủ để gỡ chỗ mơ hồ.
Câu 2
Phần tiêu đề “Câu 2”Một synthesis agent gộp findings từ ba research subagent. Báo cáo cuối viết ‘đầu tư vào năng lượng tái tạo đã tăng đáng kể’ mà không dẫn nguồn hay con số cụ thể nào. Chuyện gì đã sai?
- A. Synthesis agent diễn đạt lại findings mà không giữ claim-source mapping
- B. Các research subagent không tìm được con số cụ thể
- C. Báo cáo đã được tóm tắt đúng mức cho lãnh đạo dễ đọc
- D. Synthesis agent đã trừu tượng hoá đúng cách, bỏ đi chi tiết không cần thiết
Đáp án & giải thích
Đúng: A
- A đúng vì: attribution chết trong lúc summarisation. Synthesis agent nén findings mà không giữ claim-source mapping có cấu trúc. Bản gốc có thể là ‘$495 billion in 2023 (IEA World Energy Report 2024)’ và đã biến thành ‘đã tăng đáng kể’.
- B sai vì: đề ngụ ý các subagent đã cho ra findings chi tiết. Vấn đề nằm ở bước tổng hợp.
- C sai vì: bỏ con số và nguồn không phải là tóm tắt — đó là phá hủy thông tin. Bản tóm tắt cho lãnh đạo vẫn phải dẫn nguồn và giữ con số chính.
- D sai vì: bỏ attribution và con số không phải trừu tượng hoá. Synthesis agent phải giữ claim-source mapping một cách tường minh qua quá trình merge.
Câu 3
Phần tiêu đề “Câu 3”Một pipeline nghiên cứu multi-agent có bốn bước: (1) research subagent thu thập findings, (2) analysis subagent đánh giá findings, (3) synthesis subagent gộp findings, (4) tạo báo cáo. Attribution thường mất nhất ở bước nào?
- A. Bước 1 — research subagent hay quên ghi nguồn
- B. Bước 2 — analysis subagent bóc mất thông tin nguồn trong lúc đánh giá
- C. Bước 4 — định dạng báo cáo làm mất citation nội dòng
- D. Bước 3 — synthesis subagent gộp và diễn đạt lại mà không mang theo source mapping
Đáp án & giải thích
Đúng: D
- A sai vì: nếu research subagent dùng claim-source mapping có cấu trúc thì nguồn đã được ghi ngay lúc thu thập. Thiết kế schema đàng hoàng là xử lý được.
- B sai vì: analysis subagent thường thêm nhận định vào findings chứ không bóc chúng đi. Mapping gốc phải chảy qua được.
- C sai vì: tạo báo cáo chỉ là format máy móc. Nếu citation đã có trong output tổng hợp thì chúng sẽ được format vào báo cáo.
- D đúng vì: bước 3 là điểm hỏng phổ biến nhất. Synthesis agent tự nhiên sẽ nén và diễn đạt lại, và nếu không có chỉ dẫn tường minh về việc giữ claim-source mapping thì attribution mất trong lúc merge.
Câu 4
Phần tiêu đề “Câu 4”Một báo cáo tổng hợp cần trình bày ba loại nội dung: số liệu đầu tư theo quý phân theo ngành, một mạch tường thuật về thay đổi pháp lý, và một danh sách các pattern tích hợp API. Nên trình bày thế nào?
- A. Tất cả thành đoạn văn xuôi cho nhất quán format toàn báo cáo
- B. Tất cả thành bảng có cấu trúc để dễ quét và so sánh
- C. Số liệu đầu tư thành bảng, phần pháp lý thành văn xuôi, pattern API thành danh sách có cấu trúc
- D. Tất cả thành danh sách gạch đầu dòng để dễ đọc nhất
Đáp án & giải thích
Đúng: C
- A sai vì: ép dữ liệu tài chính vào văn xuôi làm việc so sánh giá trị khó hơn. Ép pattern kỹ thuật vào văn xuôi làm mờ cấu trúc.
- B sai vì: phần tường thuật về thay đổi pháp lý đọc rất gượng khi ở dạng bảng. Bảng dành cho so sánh số liệu, không dành cho kể chuyện nhân quả.
- C đúng vì: trình bày theo đúng loại nội dung: dữ liệu tài chính thành bảng (con số, so sánh), tin tức/tường thuật thành văn xuôi (nhân quả, trình tự thời gian), phát hiện kỹ thuật thành danh sách có cấu trúc (đặc tả, pattern).
- D sai vì: gạch đầu dòng hợp với phát hiện kỹ thuật nhưng sai với so sánh tài chính (cần bảng) và bối cảnh tường thuật (cần văn xuôi).
Câu 5
Phần tiêu đề “Câu 5”Một analysis agent gặp hai tài liệu báo hai con số doanh thu năm khác nhau cho cùng một công ty: $4.2M từ báo cáo thường niên và $3.8M từ hồ sơ nộp SEC. Analysis agent nên làm gì?
- A. Hoàn tất phân tích với cả hai giá trị đều được ghi chú
- B. Gắn cờ xung đột và dừng phân tích cho tới khi có người thật xử lý
- C. Dùng con số của báo cáo thường niên vì nó có thẩm quyền hơn
- D. Lấy trung bình hai con số và báo $4.0M là doanh thu ước tính
Đáp án & giải thích
Đúng: A
- A đúng vì: hoàn tất phân tích với xung đột giữ nguyên và ghi chú tường minh. Đưa cả hai giá trị, nguồn của chúng, và một cách giải thích khả dĩ (đã kiểm toán vs sơ bộ, năm tài chính vs năm dương lịch). Quyết định xử lý xung đột thuộc về coordinator hoặc người đọc.
- B sai vì: dừng phân tích là không tương xứng. Xung đột có thể ghi chú lại và vẫn hoàn tất phân tích. Coordinator hoặc người đọc tự quyết cách xử lý.
- C sai vì: tuỳ tiện chọn một giá trị là phá hủy thông tin. Báo cáo thường niên dùng số đã kiểm toán; hồ sơ SEC dùng số sơ bộ chưa kiểm toán. Cả hai đều hợp lệ.
- D sai vì: lấy trung bình các con số mâu thuẫn là sai về mặt toán học và phá hủy bối cảnh nguồn vốn giải thích được chênh lệch.