Giáo trình tự học miễn phí · Dịch vụ hỗ trợ theo nhu cầu.
6. Chốt Chặn Kiểm Định Đối Kháng: Evidence Gate & Adversarial Verification
Chân lý: 'Done is not evidence'. Đừng bao giờ để công nhân tự chấm điểm bài làm của mình. Xây dựng Verifier đối kháng độc lập để tìm ra lý do từ chối sản phẩm.
Khi một AI Agent thông báo với bạn: 'Tôi đã sửa xong toàn bộ lỗi và cập nhật hệ thống thành công!', bạn có nên tin nó ngay không? Câu trả lời dứt khoát là KHÔNG. Lời nói của mô hình chỉ là một token được sinh ra, hoàn toàn không phải là bằng chứng cho thấy thế giới thực tế đã thay đổi.
🛑 Done Is Not Evidence: Chỉ Môi Trường Mới Chứng Minh Được Kết Quả
Một nguyên tắc vàng trong Harness Engineering:
Mô hình có thể đề xuất rằng nhiệm vụ đã xong. Nhưng chỉ môi trường thực tế mới có quyền chứng minh điều đó.

Hệ thống phải thiết lập một Evidence Gate (Cổng Bằng Chứng) chạy các bài kiểm tra tiền định rẻ nhất trước:
- Kiểm tra cú pháp (Linter / Compiler).
- Kiểm tra kiểu dữ liệu (Schema validation).
- Kiểm tra mã băm checksum.
- Chạy bộ unit tests tự động (
pytest -q,npm test). - Kiểm tra HTTP Status Code trên môi trường sandbox.
Dùng Code cho các công việc kỹ thuật xác định. Chỉ dùng LLM cho những vùng mơ hồ.
⚔️ Kiểm Định Đối Kháng (Adversarial Verification)
Nếu bạn bảo chính Agent vừa viết code: "Hãy tự kiểm tra lại bài của mình xem có lỗi gì không", nó thường sẽ mang theo toàn bộ những giả định sai lầm ban đầu để tự biện minh cho kết quả của nó.

Kỹ thuật bất đối xứng (Asymmetry):
- Worker (Thợ thi công): Cố gắng tạo ra giải pháp tốt nhất trong khả năng.
- Verifier (Người thẩm định độc lập): Nhận nhiệm vụ cố tình bẻ gãy giải pháp và tìm ra lý do để TỪ CHỐI (Reject).
Một quy trình thẩm định đạt chuẩn cần:
- Có tiêu chí từ chối tường minh (Explicit rejection rubric).
- Có quyền truy cập vào sản phẩm tạo ra và hợp đồng nghiệm thu ban đầu.
- Chạy trong một ngữ cảnh tươi mới (Fresh context) hoặc dùng công cụ kiểm thử độc lập.
- Có quyền từ chối thẳng thừng mà không cần phải tự mình đi sửa chữa.
# QUY TRÌNH VERIFICATION GATE TRONG HARNESS (GATEKEEPER PATTERN)
def verify_task_completion(task_contract, produced_artifacts):
"""Thẩm định độc lập 2 tầng: Code Gates -> Adversarial LLM Verifier"""
# TẦNG 1: KIỂM ĐỊNH MÔI TRƯỜNG XÁC ĐỊNH (0% LLM HAL)
for check in task_contract["acceptance_criteria"]["deterministic_checks"]:
result = run_shell_command(check["command"])
if result.exit_code != check["expected_exit_code"]:
return {
"passed": False,
"reason": f"Kiểm tra môi trường thất bại tại lệnh: {check['command']}",
"evidence": result.stderr
}
# TẦNG 2: ADVERSARIAL EVALUATOR (DÙNG MODEL KHÁC ĐỂ PHẢN BIỆN)
adversarial_prompt = f"""
BẠN LÀ MỘT AUDITOR KHẮT KHE. NHIỆM VỤ CỦA BẠN LÀ TÌM LỖI ĐỂ TỪ CHỐI BẢN GIAO NÀY.
Hợp đồng cam kết: {task_contract['objective']}
Các ràng buộc bất biến: {task_contract['invariants']}
Sản phẩm thực tế: {produced_artifacts}
Chỉ trả về PASS nếu sản phẩm đáp ứng 100% không tì vết.
Nếu phát hiện dù chỉ 1 điểm vi phạm ranh giới, trả về REJECT kèm bằng chứng cụ thể.
"""
eval_response = call_evaluator_llm(adversarial_prompt)
if "REJECT" in eval_response:
return {"passed": False, "reason": eval_response}
return {"passed": True, "proof_token": generate_proof_hash()}
Thực hành và tự đánh giá
Thiết kế một bộ bài kiểm tra đối kháng (Adversarial checklist) gồm 5 câu hỏi để lật tẩy lỗi của một báo cáo tài chính hoặc một đoạn mã do AI viết.
AI Tinh Gọn hỗ trợ khảo sát hiện trạng, kèm 1-1 on-premise bảo mật dữ liệu, setup hạ tầng riêng và xuất hóa đơn VAT hợp pháp cho doanh nghiệp.
Tiến độ tự học lưu trên trình duyệt này. Chỉ đánh dấu khi đã kiểm tra sản phẩm thực hành.