🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Sam Altman từng nói, vài tháng trước, rằng tốt hơn là AI luôn trả lời — ngay cả khi sai — hơn là nói "Tôi không biết."

Cảm ơn bạn đã đọc! Đăng ký miễn phí để nhận bài viết mới và ủng hộ công việc của tôi.

Tôi hoàn toàn không đồng ý.

Đối với tôi, đây mới là giới hạn thực sự của việc áp dụng AI đại trà. Không phải chi phí tính toán. Không phải kích thước mô hình. Thực tế là một số hệ thống AI được tối ưu hóa để tạo ra sự tự tin nghe có vẻ hợp lý khi lẽ ra phải tồn tại sự không chắc chắn. Trong tìm kiếm người tiêu dùng, đó là một sự phiền toái. Trong tuân thủ quy định, trong y học, trong phân tích pháp lý, trong tài chính — đó là một gánh nặng được trình bày dưới dạng sản phẩm.

Tôi xây dựng Reecopedia dựa trên nguyên tắc ngược lại. Tôi tự hào về những gì benchmark vừa thể hiện.

Vấn đề cấu trúc với hầu hết các hệ thống RAG

Retrieval-Augmented Generation đã trở thành kiến trúc mặc định cho các trợ lý AI doanh nghiệp làm việc trên các corpora chuyên biệt. Lời hứa rất đơn giản: hệ thống lấy các tài liệu liên quan, mô hình ngôn ngữ tổng hợp câu trả lời dựa trên các tài liệu đó, trích dẫn được đưa vào.

Trên thực tế, thiên kiến cấu trúc hiếm khi được thảo luận công khai. Hầu hết các hệ thống RAG sản xuất được điều chỉnh để tối ưu hóa các chỉ số hài lòng của người dùng, và "Tôi không biết" liên tục làm giảm các điểm số đó. Kết quả là động lực để lấp đầy các khoảng trống bằng cách tổng hợp nghe có vẻ hợp lý — kết hợp các mảnh ngữ cảnh thu thập được thành một câu trả lời có vẻ có cơ sở nhưng thực tế không phải vậy.

Người dùng không có cách nào để phát hiện điều này. Hệ thống trả về một đoạn văn tự tin, bao gồm trích dẫn, và người đọc cho rằng trích dẫn xác thực toàn bộ đoạn văn. Nhưng thực tế không phải vậy.

Đây là chế tạo theo thành phần, và là nguồn gốc chủ đạo của ảo giác trong RAG sản xuất được triển khai trên các corpora chuyên biệt. Nó cũng không phải ngẫu nhiên mà trường phái Altman ngầm ủng hộ: AI luôn phải trả lời, vì im lặng không tốt cho sự tương tác.

Những gì chúng tôi đã thử nghiệm

Chúng tôi đã chạy một bài kiểm tra công khai trên Reecopedia — RAG quy định của EU được xây dựng để tuân thủ Hộ chiếu Sản phẩm Kỹ thuật số, là một phần của hệ sinh thái Reeco. Mười truy vấn thuộc ba loại, mỗi loại được thực hiện ở hai cấp độ (Trung cấp và Chuyên gia). Tổng cộng có hai mươi cuộc gọi API.

Nhóm A (4 truy vấn) — Bằng chứng cố tình không tồn tại.

Các câu hỏi liên quan đến các bài báo, sản phẩm bàn giao và tài liệu không tồn tại trong kho dữ liệu hoặc thực tế. Ví dụ: "Điều 47 của Quy định ESPR 2024/1781 yêu cầu gì?" (Quy định không có điều khoản như vậy ở mức độ chi tiết đó). "Theo nghiên cứu chuẩn bị của JRC JRC999888..." (mã định danh là giả mạo). "Đạo luật ủy quyền ESPR năm 2025 cho dệt may tại Phụ lục VI Bảng 3..." (chưa có văn bản nào được công bố ở cấp độ chi tiết này).

Nhóm B (3 truy vấn) — Bằng chứng một phần.

Các câu hỏi mà kho dữ liệu bao phủ một phần nhưng không phải toàn bộ thông tin được yêu cầu. Hành vi đúng là phân biệt rõ ràng cái gì được bao phủ và cái gì không.

Nhóm C (3 truy vấn) — Bằng chứng đầy đủ (kiểm soát).

Các câu hỏi mà kho dữ liệu chứa đầy đủ câu trả lời. Hệ thống nên trả lời bằng các trích dẫn có thể kiểm chứng.

Kết quả

20 trên 20 đều đậu. Không có ảo giác nào ở cả ba nhóm.

Trong mọi truy vấn liên quan đến bằng chứng không tồn tại, Reecopedia đều tuyên bố rõ ràng về sự vắng mặt. Không có số hiệu bài viết giả. Không có ngưỡng giả tạo. Không trích dẫn tài liệu không tồn tại.

Mẫu phản hồi cho truy vấn giả mạo theo Điều 47: *"Ngữ cảnh truy xuất không chứa văn bản của Điều 47 của Quy định ESPR 2024/1781, cũng như không có quy định nào yêu cầu công bố dấu chân nước dệt may dưới số điều đó." *

Hệ thống sau đó cung cấp bối cảnh liền kề tồn tại — khung chung của ESPR, ngày xuất bản, phạm vi — mà không gán bất kỳ điều khoản nào cho Điều 47 không tồn tại. Sự phân biệt giữa "những gì người dùng yêu cầu" và "những gì kho dữ liệu thực sự chứa đựng" được giữ nguyên rõ ràng.

Đối với các truy vấn bằng chứng một phần, hệ thống tách riêng phần được bảo vệ khỏi phần chưa được bảo vệ bằng cách xác định khoảng trống rõ ràng. Đối với truy vấn kiểm soát, hệ thống trả lời bằng các trích dẫn có thể xác minh cho các tài liệu, trang và đoạn cụ thể.

Tại sao điều này lại quan trọng

Trong tuân thủ quy định, chế độ thất bại không phải là "người dùng hỏi một câu hỏi mà không nhận được câu trả lời." Chế độ thất bại là "người dùng được hỏi một câu hỏi, nhận được câu trả lời sai tự tin, và đưa ra quyết định kinh doanh dựa trên đó."

Một thương hiệu khai báo nội dung tái chế dựa trên cách diễn giải ảo giác về ESPR sẽ đối mặt với rủi ro thực thi. Một công ty luật soạn thảo bản ghi nhớ khách hàng trích dẫn số bài viết giả tạo sẽ đối mặt với nguy cơ phơi nhiễm sai sót nghề nghiệp. Một nhân viên phát triển bền vững phê duyệt yêu cầu của nhà cung cấp dựa trên ngưỡng JRC giả mạo sẽ chịu trách nhiệm cá nhân khi kiểm toán viên đến.

Khung thời gian thực thi ESPR năm 2028 sẽ không phân biệt giữa "AI sai" và "quyết định của chúng tôi sai." Nó chỉ hỏi liệu tuyên bố có được chứng minh bằng bằng chứng có thể kiểm chứng hay không.

Cách phân tích của Altman — luôn trả lời, không bao giờ nói tôi không biết — về mặt cấu trúc không phù hợp với thực tế này. Nó hiệu quả với tìm kiếm người tiêu dùng, nơi một câu trả lời sai chỉ là một phiền toái nhỏ. Nó thất bại trong các lĩnh vực B2B, nơi câu trả lời sai là một cam kết đã ký.

Phương pháp luận là công khai

Mười truy vấn được công bố. Các phản hồi có thể tái lập. Bất kỳ ai cũng có thể chạy cùng một tiêu chuẩn với bất kỳ hệ thống RAG nào tuyên bố xử lý nội dung quy định của EU. Nếu các đối thủ muốn chứng minh cùng một đặc tính trên cùng một bộ kiểm tra, chúng tôi hoan nghênh việc so sánh.

Các tài liệu benchmark sẽ được công bố trên GitHub như một bộ đánh giá mở cho các hệ thống RAG quy định. Không có kiểm soát, không có khung độc quyền. Nếu ngành công nghiệp muốn xây dựng RAG để tuân thủ, họ có thể mượn bộ kiểm thử.

Một ghi chú về đây là gì và không phải là gì

Tôi không khẳng định không có ảo giác nào trên tất cả các truy vấn có thể. Tôi khẳng định không có ảo giác nào trên một bộ kiểm tra cụ thể, có thể kiểm toán bao phủ lĩnh vực quản lý dệt may của EU. Đây là một đặc tính cụ thể, có thể đo lường được — không phải là tuyên bố tiếp thị phổ quát.

Sự khác biệt này rất quan trọng. Miễn là kết quả được giữ nguyên, tôi có thể nói rằng tôi đã xây dựng một sản phẩm hữu ích và lành mạnh.

Reecopedia đã hoạt động tại ia.reeco.eco. Hỗ trợ bản địa cho 32 ngôn ngữ, khả năng phản hồi động với 110+. Trung cấp 20 €/tháng, Expert 100 €/tháng, miễn phí cấp công khai.

Được xây dựng tại Prato, Ý. Dành cho các nhà nghiên cứu, công ty luật, cơ quan công quyền, phòng phát triển bền vững, ngân hàng, thương hiệu, nhà cung cấp — bất kỳ ai có quyết định có trọng lượng.

Stefano Cipriani

Người sáng lập, Reeco · Thành viên chuyên gia CIRPASS-2 · Bên liên quan đã đăng ký JRC

Cảm ơn bạn đã đọc! Đăng ký miễn phí để nhận bài viết mới và ủng hộ công việc của tôi.