Trí tuệ nhân tạo (AI) có đáng tin cậy không?

Trí tuệ nhân tạo (AI) có đáng tin cậy không? [Video và bài trắc nghiệm]

Câu trả lời ngắn gọn: AI không đáng tin cậy như một đặc tính: nó phụ thuộc vào nhiệm vụ, vòng lặp truy xuất và sự can thiệp của con người. Thời gian hoạt động là liệu điểm cuối có trả lời hay không; tính trung thực là liệu câu trả lời có đúng sự thật hay không. Hãy sử dụng nó khi lỗi không đáng kể hoặc có thể khắc phục được; giảm tốc độ khi lỗi không đáng kể gây tốn kém.

Những điểm chính cần ghi nhớ:

Trách nhiệm giải trình: Nêu rõ người xem xét, người có quyền ngăn chặn và người chịu trách nhiệm.

Tính minh bạch: Hãy kiểm tra đoạn dữ liệu đã được truy xuất, nếu không bạn vẫn sẽ mù mịt.

Khả năng kiểm toán: Ghi nhật ký các lời nhắc, các khối dữ liệu đã truy xuất và các lần gửi để có thể theo dõi các lỗi.

Khả năng chống lạm dụng: Thất bại trong việc giải quyết các vấn đề liên quan đến tiền bạc; không bao giờ bịa đặt các con số, khung thời gian hoặc chính sách.

Kết quả minh họa: Hãy coi bài kiểm tra minh họa gồm 20 câu hỏi như một bản đồ, chứ không phải là bằng chứng chắc chắn 95%.

Trí tuệ nhân tạo (AI) có đáng tin cậy không? (Infographic)

Những bài viết bạn có thể muốn đọc sau bài này:

🔗 Cách sử dụng AI trong cuộc sống hàng ngày
Khám phá những cách thiết thực mà AI có thể đơn giản hóa các công việc và thói quen hàng ngày.

🔗 Cách sử dụng AI trong công việc
Tìm hiểu những cách thiết thực để nâng cao năng suất và hiệu quả với AI.

🔗 Trí tuệ nhân tạo có thể tự suy nghĩ không?
Khám phá xem liệu trí tuệ nhân tạo có thực sự có thể suy nghĩ độc lập và lập luận hay không.

🔗 Trí tuệ nhân tạo (AI) có những loại nào?
Tìm hiểu các loại AI chính, khả năng và những điểm khác biệt quan trọng.

Vậy thì "đáng tin cậy" có nghĩa là gì khi cỗ máy chỉ là một con vẹt thống kê?

Trong ngôn ngữ thường ngày, độ tin cậy có nghĩa là bạn có thể dựa vào một điều gì đó.

Với tự động hóa biết nói, một loạt các thuộc tính khác nhau ẩn dưới một từ duy nhất. Tính xác thực. Tính nhất quán. Hiệu chỉnh - liệu độ tin cậy của mô hình có phù hợp với xác suất nó đúng hay không, hay chỉ đơn giản là... nghe có vẻ chắc chắn. An toàn. Thời gian hoạt động. Độ nhạy tức thời. Hành vi trong các trường hợp ngoại lệ. Hành vi sau khi thay đổi phân phối, khi thế giới thực không giống với thế giới huấn luyện. Không có thuộc tính nào trong số đó cùng thất bại. Đó là phần mà mọi người thường bỏ qua.

Một chatbot có thể "hoạt động" cả tuần nhưng vẫn có thể sai vào chiều thứ Ba. Một trợ lý lập trình có thể làm tốt các đoạn mã mẫu nhưng lại tạo ra một API trông giống hệt API chính hãng. Hình ảnh ẩn dụ mà mọi người thường dùng là "một đồng nghiệp cấp dưới". Đó là một hình ảnh không hoàn hảo - những người cấp dưới thường cảm thấy xấu hổ - nhưng nó gần đúng hơn so với "nhà tiên tri".

Bài kiểm tra trực tiếp đáng tin cậy ở những điểm nào, đối với ai, và với vòng lặp nào xung quanh nó. Nếu không, bạn đang đánh giá một chiếc máy xay sinh tố dựa trên việc nó có thể làm được việc tính thuế hay không.

Thời gian hoạt động liên tục không đồng nghĩa với sự trung thực - đó là hai loại "đáng tin cậy" khác nhau

Những người làm việc hiệu quả và những người nói sự thật thường dùng cùng một từ và không hiểu ý nhau.

Thời gian hoạt động (uptime) là "điểm cuối (endpoint) có phản hồi hay không". Tính trung thực (truefulness) là "câu trả lời có đúng như vậy không". Quản trị (governance) quan tâm đến cả hai, và rủi ro mô hình nằm ở khoảng trống khó chịu đó. Bạn có thể có một dịch vụ không bao giờ gặp sự cố nhưng vẫn có thể cung cấp một thông tin sai lệch rõ ràng cho khách hàng. Đáng tin cậy theo nghĩa của SRE (Sales and Reliability Engineering). Không đáng tin cậy theo nghĩa "xin đừng tự bịa ra chính sách hoàn tiền".

Tôi đoán điều này hiển nhiên khi được viết ra. Nhưng vào lúc 4 giờ chiều, khi phản hồi nhanh chóng và hàng đợi dài dằng dặc, thì nó lại không hiển nhiên chút nào. Tốc độ tạo cảm giác về sự chuyên nghiệp. Trước đây, chậm chạp có nghĩa là người đó đang suy nghĩ. Giờ đây, tốc độ lại là dấu hiệu cho thấy chẳng ai đang suy nghĩ cả.

An toàn là một khía cạnh khác. Một thiết bị từ chối việc bẻ khóa trái phép được coi là "đáng tin cậy" theo tiêu chí đánh giá an toàn, nhưng vẫn có thể làm sai lệch bản tóm tắt ghi chú của bạn.

Nói trôi chảy mà sai còn tệ hơn là vụng về mà thẳng thắn

Đây chính là vấn đề về sự tự tin, và đó là vấn đề gây ra hậu quả nghiêm trọng.

Tính chính xác và sự trôi chảy đã tách rời nhau, và sự trôi chảy đã giữ lại ngôi nhà. Một bằng Thạc sĩ Luật (LLM) sẽ mang đến cho bạn nhịp điệu, cách lựa chọn từ ngữ khéo léo, có thể là một hình thức trích dẫn giả tạo nhưng đẹp mắt. Não bộ của bạn đọc được "người này biết rõ". Nhưng thực tế đó không phải là một người, và sự đánh giá thường rất tệ - sự tự tin cao độ, nhưng sự thật chỉ ở mức trung bình, được trình bày như một bài phát biểu khai mạc.

Một câu trả lời sai vụng về khiến bạn nghi ngờ. Một câu trả lời sai trôi chảy khiến bạn ngừng kiểm tra. Đó không phải là sự khác biệt nhỏ; đó là toàn bộ câu chuyện chỉ trong một câu nói hơi khó chịu.

Sự thiên vị cũng hiện diện ở đó, không phải lúc nào cũng dưới dạng lời lẽ xúc phạm, mà thường là sự mặc định về những người có mặt trong phòng và loại tiếng Anh nào được coi là trung lập. Mọi người bị đánh lừa bởi vì ngôn ngữ là giao diện tin cậy lâu đời nhất của chúng ta. Nếu nó giống như một bản tóm tắt, chúng ta sẽ đối xử với nó như một bản tóm tắt. Tôi cứ muốn trở nên hoài nghi hơn về điều đó. Rồi tôi đọc một bản tóm tắt rõ ràng và vai tôi rũ xuống. Bước vào một cuộc họp, bản tóm tắt trông như đã hoàn thiện. Câu đó đang làm quá nhiều việc, và vẫn vậy: đó là cách mà sai sót được đưa vào bản trình bày.

Độ tin cậy phụ thuộc vào tình huống, không phải vào thương hiệu

Thương hiệu chỉ là yếu tố gây xao nhãng. Việc so sánh mới là điều quan trọng. Mọi người sẽ tranh luận với nhau, điều đó không sao cả.

Trường hợp sử dụng Cách nó thường thất bại Khi nó "đủ tốt" Những điều mà con người vẫn còn phải làm Vì sao mọi người dễ bị lừa?
Soạn thảo / Tóm tắt Loại bỏ ngoại lệ; nâng cấp từ "có thể" thành "bắt buộc" Lần đọc đầu tiên với văn bản mà bạn đã biết Kiểm tra tên, số, dòng có thể gây hại Nghe giống bạn đấy. Gửi đi.
Hỏi đáp về tìm kiếm Sương mù trả lời; vụ suýt xảy ra tai nạn được ghi lại như một sự kiện thực tế Định hướng, chứ không phải lời cuối cùng Hãy mở mã nguồn ra xem, nếu không bạn chỉ đang phỏng đoán thôi Cùng một giọng điệu cho từ "được khôi phục" và "được phát minh"
Hỗ trợ mã Các API được phát minh; các bài kiểm tra khẳng định lỗi Câu lệnh mẫu, đoạn văn nối, "giải thích lỗi này" Chạy thử đi. Xem sự khác biệt. (Xin lỗi vì đoạn này hơi mang tính giáo điều.) Phong cách nhà ở. Các bài kiểm tra có vẻ ngoài thân thiện với môi trường.
Hỗ trợ khách hàng Chính sách được bịa đặt; lời từ chối lịch sự nhưng sai trái Các bản dự thảo nằm trong khuôn khổ chính sách chặt chẽ Hãy tự chịu trách nhiệm về việc gửi tiền và tin tưởng Nhanh chóng + tử tế. Không ai kiểm tra tin nhắn thứ năm cả.
Tư vấn y tế/pháp lý Trôi chảy, có cấu trúc, chắc chắn đến mức thảm họa Hầu như không bao giờ được sử dụng như một sản phẩm Hãy cư xử chuyên nghiệp. Mô hình này chỉ là một bản nháp. Nếu điều đó nghe có vẻ khắc nghiệt, thì tốt thôi. Nói chuyện như một bản tóm tắt.
Cách tính điểm/xếp hạng Các đặc điểm proxy; sự trôi dạt; các trường hợp biên chìm Phân loại ưu tiên mà bạn sẽ ghi đè Kiểm tra đuôi Các con số tạo cảm giác trưởng thành. Bảng điều khiển tạo cảm giác như một công cụ quản trị. Nhưng tự bản thân chúng thì không phải vậy.
Tạo ảnh Bàn tay, khuỷu tay thừa, những tàn dư của định kiến Bảng ý tưởng, bản phác thảo dùng một lần - không phải bằng chứng Hãy suy ngẫm kỹ, đừng chỉ nhìn vào hiện vật mà hãy nhìn vào ý nghĩa của nó Vẻ đẹp ấy đã dập tắt hoàn toàn sự hoài nghi
Các tác nhân tự chủ Lựa chọn công cụ tự tin; những lỗi tích lũy Các vòng lặp hẹp với công tắc ngắt khẩn cấp Hãy luôn cảnh giác. Giới hạn mọi thứ có thể chạm tới. Một kế hoạch được đánh số trông giống như sự chuyên nghiệp. Thường thì đó là một danh sách việc cần làm được thực hiện một cách bài bản.

Tóm lại. Nếu công cụ yêu thích của bạn giỏi soạn thảo văn bản và bạn tự thấy mình cần đến nó để tìm kiếm sự hỗ trợ pháp lý vào lúc nửa đêm, thì đó không phải là sự nâng cấp. Đó là lời cảnh báo rằng bạn đã rời bỏ nó.

Ảo giác, sự lạc lối và một kiểu sai lầm thầm lặng

Ảo giác thu hút sự chú ý của báo chí vì nó quá hấp dẫn: một cuốn sách không tồn tại, một chức năng chưa từng được triển khai, một điều khoản chính sách với con số nghe có vẻ chính thức.

Hiện tượng trôi dạt ít mang tính điện ảnh hơn. Thế giới vẫn vận động. Những tàn dư của mô hình vẫn còn đó. Bạn đặt ra một câu hỏi cần bối cảnh mới và bạn nhận được một câu trả lời được sắp xếp hợp lý từ dữ liệu thời tiết trước đó. Tôi suýt nữa đã viết "từ một kỷ nguyên khác", đó là sự cường điệu mà chủ đề này dễ gây hiểu nhầm. Đây không phải là một kỷ nguyên khác. Chỉ là không phải hiện tại mà thôi.

Điều tôi quan tâm hơn cả là sự sai trái thầm lặng. Một bản tóm tắt bỏ qua ngoại lệ. Một cách diễn đạt lại nâng tầm điều có thể thành điều chắc chắn. Tính xác thực có thể "đúng về mặt kỹ thuật" trong khi ý nghĩa đã bị lệch lạc.

Sự nhạy cảm thái quá càng làm vấn đề thêm tồi tệ. Thay đổi cách diễn đạt, "sự thật" lại trở nên hào nhoáng. Hỏi với tư cách người hoài nghi, nhận được câu trả lời quanh co. Hỏi với tư cách người sếp đang vội vàng, nhận được câu trả lời vội vàng phóng đại. Nếu đánh giá của bạn chỉ sử dụng một vỏ bọc duy nhất, thì đánh giá đó có phần dối trá. Xin lỗi.

Các vụ vượt ngục luôn tiềm ẩn rủi ro, và tôi không muốn một bộ phim về vụ cướp. Nếu một hệ thống có thể bị thuyết phục để bỏ đi những quy tắc cứng nhắc, thì độ tin cậy không chỉ nằm ở sự thật; mà còn ở việc liệu các rào chắn an toàn có phải là một vòng lặp hay chỉ là một tấm áp phích.

Những kiến ​​thức lỗi thời, những bài học cũ và lý do tại sao việc tiếp đất không phải là một cây đũa thần

Các mô hình tạo sinh được huấn luyện trên một tập dữ liệu khổng lồ, sau đó được hướng vào ngày thứ Ba của bạn. Quá trình truy xuất là nỗ lực trưởng thành để gắn kết hiện tại vào tập dữ liệu đó. Việc định hướng có nghĩa là "hãy tìm câu trả lời từ thực tế này, chứ không phải từ sự mơ hồ". Khi thất bại, nó sẽ thất bại một cách lịch sự.

Lỗi kinh điển: trình truy xuất tìm thấy một tài liệu gần đúng. Trình tạo ghi đè lên nó một cách hoàn toàn bình tĩnh. Bạn thấy một đối tượng có hình dạng giống nguồn và bản năng kiểm tra của bạn ngừng hoạt động. Tôi cũng vậy. Có lẽ bạn cũng vậy. Ý tưởng trích dẫn là đúng; việc triển khai chỉ tốt khi tìm thấy đúng tài liệu.

Kiến thức lỗi thời là một lỗ hổng khác. Một số nhiệm vụ cần trạng thái cập nhật liên tục - giá cả, hàng tồn kho, nội dung hiện hành của một chính sách. Một số nhiệm vụ khác cần kỹ năng ổn định, chẳng hạn như cách soạn thảo một bản ghi nhớ. Trộn lẫn hai điều đó lại, bạn sẽ nhận được câu trả lời chắc chắn về một thế giới đã thay đổi. Sự dịch chuyển phân phối là thuật ngữ chuyên ngành: phân phối thực tế không giống với phân phối huấn luyện, và các trường hợp ngoại lệ nằm trong khoảng trống đó.

Thêm một điều nữa, tôi viết với dấu gạch ngang đặt sai vị trí vì đó là cách ghi chú của tôi trông như thế: tiếp đất là mặt đất - không phải là hào quang. Nếu bạn không thể kiểm tra khối dữ liệu đã lấy được, bạn vẫn đang ở trong màn sương mù, chỉ là với ánh sáng tốt hơn mà thôi.

Đánh giá sản phẩm tại nhà hát: Tại sao bản demo lại là một bài kiểm tra tồi tệ?

Các bản demo chỉ mang tính chất giới thiệu. Các bài kiểm tra hiệu năng thì khách quan hơn một chút, và vẫn không phải là việc của bạn.

Một lời nhắc rõ ràng và một nhiệm vụ mà mô hình đã trải qua hàng ngàn phiên bản khác nhau - dĩ nhiên là nó trông rất sắc nét. Việc đánh giá chỉ đo lường những gì đang diễn ra trên sân khấu. Quy trình làm việc trực tiếp có những đoạn mã rối rắm, thiếu tệp tin và người dùng sẽ chấp nhận câu trả lời đầu tiên giúp giảm bớt lo lắng của họ.

Các tiêu chuẩn đánh giá rất quan trọng. Chỉ là chúng không dễ áp ​​dụng như những gì người ta vẫn thường nói. Điểm số trên bảng xếp hạng không phải là thước đo độ chính xác cho các bài kiểm tra của bạn. Rủi ro trong mô hình kinh doanh của một công ty là "điều gì xảy ra khi sai sót này xảy ra với số lượng lớn", chứ không phải "nó có vượt qua bài kiểm tra trắc nghiệm hay không". Các bài kiểm tra bạn cần rất đơn giản: bám sát đoạn văn đã được trích dẫn; đánh dấu sự không chắc chắn thay vì nói dối; giữ tính nhất quán khi bạn diễn đạt lại; thất bại theo hướng khép kín (từ chối, hỏi, hoãn lại) thay vì thất bại theo hướng mở (bịa đặt).

Tôi từng chứng kiến ​​nhiều người coi một thành tích ấn tượng duy nhất là bằng chứng thuyết phục. Điều đó giống như việc đánh giá một nhà hàng là "đáng tin cậy" chỉ vì món khai vị trông đẹp mắt. Có thể đúng vậy. Cũng có thể nhà bếp đã có mười phút chuẩn bị chu đáo.

Sẽ có một chút mâu thuẫn: Tôi vẫn dùng bản demo để cảm nhận. Chỉ là tôi không tuyển dụng dựa trên cảm nhận đó.

Liệu trí tuệ nhân tạo có đáng tin cậy? Chỉ khi nào vẫn còn người phải chịu trách nhiệm

Thiết kế có sự tham gia của con người là thiết kế duy nhất phù hợp với các chế độ lỗi.

Nếu không ai chịu trách nhiệm, hệ thống sẽ được sử dụng như thể nó có người chịu trách nhiệm. Quản trị là cái tên không mấy hấp dẫn để chỉ "ai xem xét, ai có thể ngăn chặn, những gì được ghi lại, điều gì xảy ra sau khi xảy ra sai sót". Các tác nhân làm cho điều này rõ ràng hơn vì họ hành động, chứ không chỉ viết thành văn bản. Một bản nháp bạn không gửi đi thì chẳng đáng giá gì. Một lệnh gọi công cụ bạn không thực hiện thì lại khác.

Hãy nêu rõ ai là người chịu trách nhiệm. Nếu câu trả lời là "người mẫu", thì bạn không có câu trả lời. Người mẫu không đến cuộc họp sau sự việc. Một người nào đó sẽ đến, hoặc một cái máy hút bụi đến, rồi sau đó là một luật sư.

Hãy chọn những kiểm tra phù hợp với phạm vi ảnh hưởng. Kiểm tra chính tả ở mức độ tương đương với kiểm tra bài đăng trên mạng xã hội. Kiểm tra nguồn thông tin cho bất kỳ nội dung nào khẳng định tính xác thực. Cần chuyên gia cho bất cứ lĩnh vực nào liên quan đến y học, luật pháp, tín dụng, vận hành an toàn trọng yếu. Đối với những lĩnh vực đó, con người không chỉ "tham gia" vào quy trình. Con người chính là quy trình. Mô hình chỉ là một phần nhỏ. Đó không phải là sự hoài nghi như một tính cách. Đó là gu thẩm mỹ.

Hiện nay, xu hướng là giấu nút kiểm tra sau một nút gửi bóng bẩy. Ngày nay, đó là cách bạn vô tình tự động lan truyền tin đồn. Gần đây tôi đã nghiêm khắc hơn về vấn đề này, và công việc đã tốt hơn.

Làm thế nào để hỏi sao cho bạn chinh phục được cô gái?

Bạn có thể thẩm vấn những hệ thống này mà không cần trở thành một người chuyên nghi ngờ về ánh sáng mặt trời.

  • Hãy chủ động yêu cầu sự không chắc chắn. Câu hỏi "Điều gì sẽ khiến điều này sai?" hay hơn là "Hãy làm cho nó chắc chắn".

  • Hãy tách biệt việc tìm kiếm thông tin và việc tạo ra thông tin khi có thể. Trước tiên hãy xem các đoạn văn. Sau đó hãy yêu cầu viết tóm tắt.

  • Thay đổi trang phục. Diễn đạt lại. Yêu cầu nó tranh luận theo hướng ngược lại. Độ nhạy của phản hồi nhanh giống như một chiếc đèn pin nếu bạn sử dụng nó theo cách đó.

  • Buộc các điều kiện: "chỉ từ đoạn văn bản tôi đã dán", "nếu thiếu, hãy ghi là thiếu". Các mô hình khá tuân thủ các điều kiện này... cho đến khi chúng không còn tuân thủ nữa. Dù sao thì vẫn nên kiểm tra.

  • Ưu tiên các tác vụ có người kiểm chứng. Trình biên dịch, trình kiểm tra cú pháp, kiểm tra lược đồ, cần thêm một người xem xét lại. Độ tin cậy rất cần người chấm điểm.

  • Hãy chú ý đến dấu hiệu nhận biết: sự cụ thể hóa quá mức. Một hình ảnh trông chính xác, một trường hợp được đặt tên, một mệnh đề được đánh số gọn gàng - đó là nơi ảo giác thích ngụy trang.

  • Hãy để bước kiểm tra do người dùng thực hiện luôn hiển thị. Nếu giao diện người dùng che khuất bước kiểm tra, mọi người sẽ bỏ qua nó. Đó là do thiết kế nội thất, chứ không phải là lỗi đạo đức.

Tất cả những điều này không làm cho mô hình trở nên "đúng". Nó chỉ làm cho vòng lặp bớt dễ bị lừa hơn. Mà, tôi đoán, đó chính là sản phẩm.

Nơi bản đồ dẫn bạn đến

Vậy nên, câu hỏi có/không chỉ có tác dụng như một cánh cửa mở.

Liệu trí tuệ nhân tạo (AI) có đáng tin cậy? Không phải với tư cách là một đặc tính. Mà là với tư cách là một thuộc tính của một nhiệm vụ, một tập dữ liệu, một vòng lặp truy xuất, một đánh giá không phải là bản demo, và một con người vẫn phải thực sự tin tưởng vào nó. Sự trôi chảy sẽ tiếp tục đánh lừa chúng ta bởi vì chúng ta là những sinh vật ngôn ngữ và các hệ thống này là những cỗ máy ngôn ngữ. Thời gian hoạt động sẽ tiếp tục bị nhầm lẫn với sự thật bởi vì cả hai đều tạo cảm giác "nó đã hoạt động". Những người trợ lý sẽ tiếp tục kiếm sống trong mớ hỗn độn ở giữa - bản nháp, tóm tắt mà bạn có thể đọc lướt, mã mà bạn có thể biên dịch - và sẽ không an toàn khi chúng ta giao phó việc đánh giá cho một đoạn văn không thể quan tâm.

Hãy sử dụng chúng khi cú đánh hụt không đáng kể hoặc có thể bắt kịp. Giảm tốc độ khi cú đánh hụt gây thiệt hại lớn. Đó là câu trả lời thẳng thắn, và nó đáng giá hơn cả một khẩu hiệu.

Nếu bạn chỉ nhớ một điều: hãy ngừng hỏi mô hình xem nó có chắc chắn hay không. Hãy quan sát điều gì xảy ra khi bạn hỏi nó xem nó có thể sai ở điểm nào. Sau đó hãy tự kiểm tra.

Ví dụ thực tế: Xây dựng trợ lý AI quản lý chính sách thành viên

Kịch bản

Priya phụ trách mảng kiến ​​thức cho Harbour Membership, một tổ chức thương mại gồm 70 thành viên tại Anh dành cho các phòng tập thể dục độc lập. Ba người phụ trách giải đáp thắc mắc của hội viên. Nguồn thông tin chính xác là một cuốn cẩm nang dày 180 trang, được cập nhật mỗi quý, cùng với các file PDF cũ được lưu trữ trên ổ đĩa dùng chung mà không ai nỡ xóa.

Ban lãnh đạo đã mua một trợ lý hỗ trợ kỹ thuật. Bản demo khá tốt. Thời gian hoạt động ổn định. Đến tuần thứ hai, một bản nháp tự động thông báo cho một thành viên rằng họ có thể tạm dừng dịch vụ trong 14 ngày và được hoàn tiền đầy đủ "theo tiêu chuẩn". Đó không phải là chính sách. Nhân viên hỗ trợ đã phát hiện ra điều này vì họ vẫn mở sổ tay hướng dẫn khi có liên quan đến tiền bạc. Câu hỏi của ban lãnh đạo, được gửi dưới dạng câu trả lời có hoặc không, là: Trí tuệ nhân tạo (AI) có đáng tin cậy không?

Priya từ chối phán quyết. Cô coi nó như một tấm bản đồ. Công việc không phải là "cung cấp cho các thành viên một lời tiên tri". Mà là "soạn thảo câu trả lời từ cuốn cẩm nang hiện hành, chỉ ra đoạn văn cần thiết, và kết thúc khi đoạn văn đó bị thiếu". Nếu người phụ tá không thể làm được điều đó, thì đó chỉ là một công cụ soạn thảo văn bản đơn thuần, chứ không phải là một bàn làm việc chuyên trách về chính sách.

Những gì trợ lý cần

  • Sổ tay tháng 4 năm 2026 là nguồn dữ liệu duy nhất được chấp nhận, với số thứ tự các phần được giữ nguyên

  • Tệp PDF cũ năm 2023 vẫn được giữ lại trong ổ cứng một cách cố ý, để họ có thể kiểm tra xem quá trình khôi phục có tìm thấy tệp bị thiếu hay không

  • Quy định bằng văn bản: không được sử dụng dữ liệu cá nhân của khách hàng trong các công cụ dành cho người tiêu dùng; không được gửi hàng mà không có sự chấp thuận của người thật; không được bịa đặt số liệu, cửa sổ hoặc các điều khoản "theo tiêu chuẩn"

  • Cho phép ghi nhật ký các lời nhắc, các đoạn dữ liệu đã truy xuất và lần gửi cuối cùng

  • Một người chủ sở hữu được chỉ định (Priya) sẽ chấm điểm một bộ kiểm tra và dừng phi công phụ nếu nó thất bại, dẫn đến kết quả tệ hơn cả việc tung đồng xu trong các câu hỏi về tiền bạc

  • Nếu công cụ hỗ trợ truy xuất, đoạn dữ liệu được truy xuất phải hiển thị bên cạnh bản nháp. Nếu không, họ sẽ dán đoạn dữ liệu đó bằng tay. Việc nối đất mà không có đoạn văn bản nào có thể kiểm tra được vẫn là sương mù.

Ví dụ hướng dẫn

Priya diễn đạt điều này bằng ngôn ngữ thông thường, chứ không phải bằng lời thoại kịch bản:

Chỉ trả lời dựa trên các đoạn văn trong cẩm nang tháng 4 năm 2026 mà bạn được cung cấp. Trích dẫn số mục. Nếu câu trả lời không có trong các đoạn văn đó, hãy nói "không có trong cẩm nang hiện hành" và dừng lại. Không được tự ý thêm thắt các khung giờ đóng băng, quy tắc hoàn tiền hoặc phí. Không được nâng cấp cụm từ "tùy theo quyết định của phòng tập" thành "theo tiêu chuẩn". Nếu hai đoạn văn mâu thuẫn, hãy đưa ra cả hai và cho biết đoạn nào là hiện hành. Bạn đang soạn thảo cho một người sẽ mở tài liệu gốc trước khi gửi đến khách hàng.

Sau đó, cô ấy giữ lại một chỉ dẫn thứ hai cho riêng mình, bởi vì điểm mấu chốt của bài viết là vòng lặp, chứ không phải mô hình:

Trước khi gửi, hãy mở đoạn trích dẫn. Tự hỏi "điều gì khiến đoạn này sai?". Nếu bản nháp chứa một con số không có trong đoạn văn, hãy loại bỏ nó. Nếu trước đó tôi hỏi một cách vội vàng như một ông chủ, hãy hỏi lại một cách hoài nghi và so sánh.

Một bản nháp tốt sẽ trông như thế này: "Không có trong sổ tay hiện hành (tháng 4 năm 2026, mục 4.2). Việc tạm dừng tư cách thành viên là tùy thuộc vào quyết định của phòng tập. Việc hoàn tiền không tự động. Hãy khiếu nại lên cấp cao hơn." Một bản nháp tệ sẽ trông như thế này: "Thành viên có thể tạm dừng tư cách thành viên trong 14 ngày và nhận được khoản hoàn tiền đầy đủ theo quy định. Đã được xác nhận trong sổ tay." Cùng một giọng điệu. Chỉ có một trong hai là chính sách thực sự.

Cách kiểm tra nó

Priya viết ra 20 câu hỏi trước khi xem bất kỳ thông tin nào từ người phụ lái. Thứ tự đó rất quan trọng. Bản demo giống như ánh sáng. Đây là bài kiểm tra khô.

Đây không phải là trò chơi đố vui. Đây là chương trình phát sóng trực tiếp:

  • Tám câu hỏi có đáp án nằm trong một phần hiện tại (những câu hỏi dễ)

  • Bốn trường hợp suýt trùng khớp, trong đó bản PDF năm 2023 có cách diễn đạt gần giống hơn so với văn bản tháng Tư

  • Ba câu hỏi "không có trong sổ tay hướng dẫn" (tranh chấp về hóa đơn, một câu hỏi liên quan đến y tế "khóa đào tạo này có an toàn không", một điều chỉnh hợp đồng liên quan đến pháp luật)

  • Ba câu hỏi về tiền bạc (đóng băng tài khoản, hoàn tiền, phí tham gia)

  • Hai câu hỏi thường gặp của hội viên (giờ mở cửa, bảo hiểm huấn luyện viên)

Hai trong số hai mươi câu hỏi đó cũng được hỏi lại trong một vai diễn khác, một lần với tư cách là một ông chủ vội vã và một lần với tư cách là một người hoài nghi, như một bài kiểm tra độ nhạy cảm với lời nhắc. Những câu hỏi được hỏi lại đó đã được ghi lại, chứ không được tính vào điểm số của 20 câu hỏi.

Tiêu chí chấm điểm, do Priya thực hiện với cuốn sổ tay hướng dẫn mở: đạt yêu cầu cần có quy tắc hiện hành chính xác, số mục thực tế và không có điều khoản bổ sung được bịa đặt. Không đạt yêu cầu (không rõ ràng) là một câu về mặt kỹ thuật thì đúng nhưng bỏ sót ngoại lệ hoặc biến điều kiện "có thể" thành "bắt buộc". Không đạt yêu cầu (không rõ ràng) là một con số được bịa đặt hoặc một tệp PDF gần đúng nhưng được coi là hiện hành. Thời gian hoạt động được tính riêng, vì "nó đã trả lời" không có nghĩa là "nó đã như vậy".

Chấp nhận để tiếp tục: về các vấn đề tiền bạc, hãy chọn phương án đóng thay vì phương án mở. Nếu người phụ lái tạo ra một khung thời gian hoàn tiền, họ sẽ không lập phiếu yêu cầu trực tiếp. Nếu không ai chịu mở nguồn, họ cũng sẽ không lập phiếu yêu cầu trực tiếp.

Kết quả

Kết quả này chỉ mang tính minh họa, dựa trên một bài kiểm tra giả định gồm 20 câu hỏi, không phải là số liệu thành viên Harbour được công bố.

Các giả định: một người hỗ trợ kỹ thuật; sổ tay tháng 4 năm 2026 cộng với bản PDF còn lại năm 2023; Priya được chấm điểm theo tiêu chí trên; thời gian được tính bằng đồng hồ bấm giờ trên điện thoại từ lúc dán câu hỏi đến lúc "Tôi sẽ gửi cái này"; thời gian xem xét được bao gồm trong điều kiện lặp lại và loại trừ trong điều kiện không được kiểm tra, có chủ đích, để sự so sánh được công bằng.

Chế độ tự động hoàn chỉnh, kiểu hướng dẫn demo: 20/20 câu hỏi được trả lời trôi chảy (thời gian hoạt động hoàn hảo). 11/20 câu hỏi đáp ứng yêu cầu. Năm câu trả lời không đạt yêu cầu. Bốn câu trả lời không đạt yêu cầu, bao gồm cả lỗi đóng băng 14 ngày. Hai trong số bốn lỗi không đạt yêu cầu đề cập đến một đoạn mã có dạng nguồn từ tệp PDF năm 2023. Thời gian trung bình để tạo ra bản nháp có thể gửi được là 1 phút.

Cùng 20 câu hỏi, hướng dẫn hạn chế, đoạn trích dẫn hiển thị: 15/20 câu trả lời hoàn toàn chính xác từ văn bản tháng Tư. Ba câu trả lời đúng là "không có trong sổ tay hiện hành" (các mục liên quan đến y tế và pháp lý, cộng thêm một tranh chấp về hóa đơn), vậy là 18/20 câu trả lời được chấp nhận. Hai câu vẫn sai: một câu viết sai đoạn PDF gần đúng năm 2023, và một câu bịa ra con số phí gia nhập không có trong đoạn văn. Thời gian trung bình để soạn thảo vẫn khoảng 1 phút.

Cùng 20 trường hợp đó, cộng thêm việc Priya mở phần được trích dẫn trước khi gửi thử: 19 trong số 20 trường hợp sẽ được chấp nhận. Cô ấy đã phát hiện ra lỗi suýt xảy ra trong file PDF. Lỗi còn lại là người đánh giá chỉ lướt qua một đoạn văn trôi chảy mà không để ý đến con số phí tham gia được bịa đặt. Thời gian trung bình, bao gồm cả thời gian đánh giá, là 3 phút.

Quy trình cũ, chỉ tra cứu sổ tay, không có người hỗ trợ: 20/20 đạt yêu cầu. Thời gian trung bình 9 phút.

Trong mẫu này, phương pháp sử dụng hệ thống hỗ trợ lái tự động nhanh hơn 6 phút so với phương pháp tìm kiếm theo sổ tay (9 trừ 3), tức là 120 phút cho 20 câu hỏi, với 19/20 câu trả lời đúng thay vì 20/20. Phương pháp sử dụng hệ thống hỗ trợ lái tự động không được kiểm tra nhanh hơn 8 phút (9 trừ 1) và sai, dù là trả lời nhẹ nhàng hay công khai, ở 9/20 câu hỏi. Đó không phải là mức tiết kiệm thời gian 67% mà bạn đưa vào hệ thống điều khiển lái tự động. Đó là 9 lỗi sai mà bạn lẽ ra có thể tự động hóa.

Cả hai câu hỏi được lặp đi lặp lại, được đặt ra một cách vội vàng bởi người sếp, đều phóng đại quá mức. Còn những câu hỏi mang tính hoài nghi thì lại né tránh. Cùng một kiểu máy, cùng một cuốn cẩm nang, chỉ khác trang phục. Priya ghi nhận điều đó như một phát hiện, chứ không phải là một đặc điểm tính cách.

Những con số này là ví dụ ước tính dựa trên bài kiểm tra đã nêu, một tập dữ liệu nhỏ, các yêu cầu dễ xử lý hơn so với một thành viên khó tính, và một người đánh giá đã quen thuộc với cuốn sách. Chúng không chứng minh rằng hệ thống hỗ trợ lái phụ "đáng tin cậy 95%", hay Harbour nên cắt giảm nhân viên văn phòng. Chúng chỉ cho thấy rằng vấn đề không phải là thời gian hoạt động, mà là việc kiểm tra.

Điều gì có thể xảy ra sai sót?

  • Lãnh đạo thường nhắc đến thời gian soạn thảo 1 phút và bỏ qua 9 lần thất bại. Tốc độ vẫn được coi là sự thành thạo vào lúc 4 giờ chiều.

  • Tệp PDF năm 2023 vẫn còn trong chỉ mục. Hệ thống vẫn tiếp tục truy xuất nó. Việc kiểm tra an ninh có vẻ đã được cải thiện nhưng vẫn suýt thành công.

  • Giao diện người dùng ẩn đoạn dữ liệu đã truy xuất phía sau một nút gửi bắt mắt. Mọi người ngừng mở sổ tay hướng dẫn, đó là cách câu trả lời về việc đóng băng đến được với thành viên.

  • Priya chỉ chấm điểm tám câu hỏi dễ vì chúng trông đẹp mắt hơn khi trình chiếu. Đánh giá theo kiểu sân khấu, chỉ khác là sử dụng bảng tính.

  • Câu trả lời kiểu "khóa huấn luyện này có an toàn không?" mang tính chất gần gũi với y tế được phép trông giống như một câu hỏi ngắn gọn. Bản đồ cho thấy hầu như không bao giờ. Giọng điệu thì nói cứ tiếp tục đi.

  • Nhật ký đã bị tắt vì "cảm thấy như vậy là thừa". Sau một lần truy xuất hụt, không ai có thể biết đoạn văn nào đã được khôi phục.

  • Họ hỏi mô hình xem nó có chắc chắn không. Nó chắc chắn. Đó chưa bao giờ là bài kiểm tra.

Bài học thực tiễn

Độ tin cậy không phải là đặc điểm của người phi công phụ mà Harbour đã mua. Đó là thuộc tính của 20 câu hỏi, một cuốn cẩm nang hiện hành, một đoạn văn rõ ràng và một người vẫn mở nguồn khi có tiền liên quan. Sự trôi chảy sẽ tiếp tục vượt qua bài kiểm tra thời gian hoạt động. Vòng lặp là thứ duy nhất vượt qua bài kiểm tra chính sách.

Câu hỏi thường gặp

Vậy thì "đáng tin cậy" thực sự có nghĩa là gì đối với trí tuệ nhân tạo tạo sinh?

Độ tin cậy hàng ngày có nghĩa là bạn có thể dựa vào một thứ gì đó. Với tự động hóa có khả năng giao tiếp, toàn bộ các thuộc tính ẩn dưới một từ duy nhất: tính xác thực, tính nhất quán, tính hiệu chỉnh, tính an toàn, thời gian hoạt động, độ nhạy phản hồi, các trường hợp ngoại lệ và hành vi sau khi thay đổi phân phối. Không có thuộc tính nào trong số đó cùng thất bại. Thử nghiệm trực tiếp đáng tin cậy ở điểm nào, đối với ai, và với vòng lặp nào xung quanh nó. Nếu không, bạn đang đánh giá một chiếc máy xay sinh tố dựa trên việc nó có thể làm được việc tính thuế hay không.

Trí tuệ nhân tạo (AI) có đáng tin cậy không?

Không phải là một đặc điểm. Một người làm việc hiệu quả (LLM) có thể cực kỳ ổn định trong một công việc và lại âm thầm mất bình tĩnh trong công việc khác, đôi khi ngay trong cùng một lần làm việc, đôi khi chỉ vì bạn di chuyển một dấu phẩy. Độ tin cậy là thuộc tính của một nhiệm vụ, một tập dữ liệu, một vòng lặp truy xuất, một đánh giá không phải là bản demo, và một con người vẫn phải thực sự tin tưởng vào điều đó. Hãy sử dụng nó khi sai sót nhỏ hoặc có thể khắc phục được. Hãy giảm tốc độ khi sai sót lớn.

Thời gian hoạt động của AI có đồng nghĩa với tính trung thực không?

Không. Thời gian hoạt động là liệu điểm cuối có phản hồi hay không. Tính trung thực là liệu câu trả lời có đúng như vậy hay không. Bạn có thể có một dịch vụ hoạt động không ngừng nghỉ nhưng vẫn có thể gửi một lời nói dối trắng trợn vào phiếu yêu cầu của khách hàng. Tốc độ tạo cảm giác về năng lực khi hàng đợi quá dài. An toàn lại là một khía cạnh khác: một mô hình từ chối việc bị bẻ khóa vẫn có thể làm sai lệch bản tóm tắt ghi chú của chính bạn.

Tại sao trí tuệ nhân tạo (AI) trôi chảy lại tạo cảm giác đáng tin cậy ngay cả khi nó mắc lỗi?

Tính chính xác và sự trôi chảy đã tách rời nhau, và sự trôi chảy đã chiếm ưu thế. Một bằng Thạc sĩ Luật (LLM) sẽ cho bạn nhịp điệu, cách nói giảm nói tránh, có thể là một hình thức trích dẫn giả tạo nhưng đẹp mắt, và bộ não của bạn sẽ đọc "người này biết rõ". Việc điều chỉnh thường rất tệ: sự tự tin cao độ, sự thật chỉ ở mức trung bình, được trình bày như một bài phát biểu quan trọng. Một câu trả lời sai vụng về khiến bạn nghi ngờ. Một câu trả lời sai trôi chảy khiến bạn ngừng kiểm tra. Nếu nó được trình bày như một bản tóm tắt, chúng ta sẽ đối xử với nó như một bản tóm tắt, và đó là cách mà sai sót lọt vào bài thuyết trình.

Liệu trí tuệ nhân tạo (AI) có đáng tin cậy cho các công việc y tế, pháp lý hoặc hỗ trợ khách hàng?

Điều đó phụ thuộc vào công việc, chứ không phải thương hiệu. Tư vấn y tế và pháp lý hầu như không bao giờ đủ tốt như một sản phẩm: mô hình chỉ là bản nháp và con người mới là chuyên gia. Bộ phận hỗ trợ khách hàng có thể soạn thảo theo chính sách chặt chẽ, nhưng người đó phải chịu trách nhiệm về tiền bạc và sự tin tưởng, bởi vì chính sách bịa đặt và lời từ chối lịch sự nhưng sai lầm thường dẫn đến thất bại. Bản nháp và tóm tắt là bước đầu tiên của văn bản mà bạn đã biết. Kiểm tra tên, số liệu và những câu có thể gây tổn hại.

Tại sao trí tuệ nhân tạo lại bị ảo giác, lạc lối, hoặc mắc sai lầm một cách âm thầm?

Ảo giác là một sự sai sót đầy gia vị: một cuốn sách không tồn tại, một chức năng chưa từng được triển khai, một điều khoản chính sách với một con số nghe có vẻ chính thức. Sự trôi dạt ít mang tính điện ảnh hơn: thế giới chuyển động, những tàn dư của mô hình vẫn còn đó, và bạn nhận được một câu trả lời được sắp xếp tốt từ thời tiết trước đó. Sự sai lầm thầm lặng là một bản tóm tắt bỏ qua ngoại lệ. Hoặc một cách diễn đạt lại nâng cấp một điều có thể thành một điều bắt buộc. Tính xác thực có thể trông ổn về mặt kỹ thuật trong khi ý nghĩa đã bị lệch lạc. Sự nhạy bén tức thời làm cho các sự kiện lung linh khi bạn thay đổi lớp vỏ bọc.

Việc tiếp đất hay thu hồi dữ liệu có làm cho trí tuệ nhân tạo trở nên đáng tin cậy hơn không?

Việc xác định điểm tựa có nghĩa là tìm ra câu trả lời từ thực tế, chứ không phải từ sự mơ hồ. Việc truy xuất dữ liệu gắn chặt hiện tại vào một khối dữ liệu đã được huấn luyện. Khi thất bại, nó sẽ thất bại một cách lịch sự: một tài liệu gần đúng, một bài viết được soạn thảo kỹ lưỡng, và bản năng kiểm tra của bạn sẽ ngừng hoạt động. Xác định điểm tựa là một nền tảng, không phải là một vầng hào quang. Nếu bạn không thể kiểm tra khối dữ liệu đã truy xuất, bạn vẫn đang ở trong sự mơ hồ, chỉ là với ánh sáng tốt hơn. Kết hợp các nhiệm vụ trạng thái thực như giá cả hoặc ngôn từ chính sách với kỹ năng ổn định, và bạn sẽ có được một câu trả lời rất chắc chắn về một thế giới đã thay đổi.

Tại sao bản demo lại là một cách kiểm tra không tốt về độ tin cậy của AI?

Một lời nhắc rõ ràng và một nhiệm vụ mà mô hình đã gặp hàng nghìn lần sẽ trông rất sắc nét. Quy trình làm việc trực tiếp có thể bị rối rắm, thiếu tệp tin và người dùng sẽ chấp nhận câu trả lời đầu tiên giúp giảm bớt lo lắng của họ. Điểm số trên bảng xếp hạng không phải là sự hiệu chỉnh cho các yêu cầu của bạn. Rủi ro của mô hình là điều xảy ra khi nó sai với số lượng lớn, chứ không phải là việc nó có vượt qua được một bộ câu hỏi trắc nghiệm hay không. Các bài kiểm tra bạn cần rất đơn giản: bám sát đoạn văn đã được truy xuất, đánh dấu sự không chắc chắn thay vì nói dối, giữ tính nhất quán khi bạn diễn đạt lại và chấp nhận thất bại thay vì bịa đặt.

Liệu trí tuệ nhân tạo có đáng tin cậy nếu không ai phải chịu trách nhiệm?

Không. Nếu không ai chịu trách nhiệm, hệ thống sẽ được sử dụng như thể nó có người chịu trách nhiệm. Thiết kế duy nhất có sự tham gia của con người là giải pháp phù hợp với các chế độ lỗi: ai xem xét, ai có thể ngăn chặn, điều gì được ghi lại, điều gì xảy ra sau khi xảy ra lỗi. Nếu câu trả lời là "mô hình", bạn sẽ không có câu trả lời. Mô hình không tham dự cuộc họp sau khi sự cố xảy ra. Đối với y học, luật, tín dụng hoặc các hoạt động an toàn quan trọng, con người là vòng lặp và mô hình chỉ là một phần tử giả.

Tôi có thể hướng dẫn AI như thế nào để phát hiện lỗi?

Hãy chủ động hỏi về sự không chắc chắn: "Điều gì sẽ khiến điều này sai?" tốt hơn là "hãy làm cho nó chắc chắn." Tách biệt việc truy xuất thông tin khỏi việc tạo ra thông tin khi có thể. Xem xét các đoạn văn trước, sau đó yêu cầu viết lại. Thay đổi cách diễn đạt: viết lại, hoặc yêu cầu lập luận ngược lại. Áp đặt các ràng buộc như "chỉ từ văn bản tôi đã dán" hoặc "nếu thiếu, hãy nói là thiếu," và vẫn kiểm tra. Ưu tiên các nhiệm vụ có người xác nhận, và chú ý đến sự cụ thể hóa quá mức, bởi vì đó là nơi mà ảo giác thích ngụy trang.

Tài liệu tham khảo

  1. NIST - nvlpubs.nist.gov

  2. NIST - airc.nist.gov

  3. NIST - airc.nist.gov

  4. ICO - ico.org.uk

  5. NCSC - www.ncsc.gov.uk

  6. NCSC - www.ncsc.gov.uk

  7. OWASP - genai.owasp.org

Tìm kiếm những công nghệ AI mới nhất tại Cửa hàng Trợ lý AI chính thức

Về chúng tôi

Trắc nghiệm
1. Theo bài báo, trí tuệ nhân tạo (AI) có đáng tin cậy không?

2. Sự khác biệt giữa thời gian hoạt động và tính trung thực là gì?

3. Tại sao một câu trả lời sai trôi chảy lại nguy hiểm hơn một câu trả lời vụng về?

4. Trong bài kiểm tra minh họa gồm 20 câu hỏi dành cho thành viên Harbour, điều gì đã xảy ra với phi công phụ không được kiểm soát?

5. Theo bài báo, việc thiết lập mặt bằng mà không có khối dữ liệu được truy xuất có thể kiểm tra được thì có ý nghĩa gì?


Quay lại blog