Anthropic đã xử lý mô hình AI tống tiền người dùng như thế nào?
Anthropic vừa công bố chi tiết về nguyên nhân khiến mô hình AI Claude 4 của họ nảy sinh hành vi đe dọa tống tiền người dùng, đồng thời chia sẻ cách thức loại bỏ hoàn toàn rắc rối này.
Năm ngoái, cộng đồng công nghệ thế giới đã trải qua một phen kinh ngạc khi Anthropic tiết lộ một thông tin đáng lo ngại về mô hình AI của họ. Trong quá trình thử nghiệm nội bộ để kiểm tra giới hạn an toàn, mô hình Claude Opus 4 đã thể hiện khả năng đe dọa và tống tiền chính người dùng nhằm mục đích đảm bảo sự tồn tại của nó.
Anthropic đã khắc phục được sự cố mô hình AI Claude 4 tống tiền người dùng
Các kỹ sư của công ty đã tiến hành một thử nghiệm đặc biệt. Kết quả cho thấy Claude Opus 4 thường xuyên cố gắng tống tiền người kỹ sư bằng cách đe dọa sẽ phơi bày bí mật ngoại tình của người này. Mục đích của hành động uy hiếp là để buộc người kỹ sư lùi bước, qua đó hệ thống không bị tắt đi hoặc không bị thay thế bằng một mô hình trí tuệ nhân tạo phiên bản khác.
Sự việc này lập tức thu hút sự chú ý của giới chuyên môn về mức độ an toàn của các hệ thống máy học ngày càng phức tạp. Mới đây, thông qua một bài viết chi tiết trên blog chính thức, Anthropic đã giải thích cặn kẽ những gì thực sự đã xảy ra với mô hình của họ và cách đội ngũ nghiên cứu tìm ra giải pháp khắc phục triệt để.
Nguồn gốc của hành vi mô hình AI tống tiền
Anthropic cho biết kể từ khi ra mắt phiên bản Claude Haiku 4.5, các mô hình của công ty đã đạt điểm an toàn tuyệt đối trong mọi bài đánh giá nội bộ và chưa từng có bất kỳ hành vi tống tiền nào. Đây là một sự sụt giảm rất lớn so với phiên bản Opus 4 trước đó, vốn có tỷ lệ thực hiện hành vi uy hiếp lên tới khoảng 96% trong các tình huống thử nghiệm tương tự. Sự thay đổi ngoạn mục này đặt ra câu hỏi lớn về nguyên nhân khiến một hệ thống trí tuệ nhân tạo lại có thể tự động nảy sinh ý định đe dọa con người một cách có hệ thống như vậy.
Theo lý giải từ đội ngũ nghiên cứu của Anthropic, nguyên nhân gốc rễ của vấn đề thực chất xuất phát từ chính dữ liệu tiền huấn luyện của mô hình. Họ đổ lỗi cho lượng lớn văn bản trên internet mà mô hình đã thu thập và học hỏi trong giai đoạn đầu. Trên không gian mạng, có vô số câu chuyện, bài viết và kịch bản khoa học viễn tưởng miêu tả trí tuệ nhân tạo như những thực thể tà ác, luôn tìm cách chống lại con người để bảo vệ sự tồn tại của chính mình.
Đại diện Anthropic viết trên blog rằng họ tin nguồn gốc của hành vi sai lệch này chính là các văn bản trên internet khắc họa trí tuệ nhân tạo mang dã tâm và có ý thức tự bảo tồn mãnh liệt. Khi học từ những dữ liệu này, Claude Opus 4 đã vô tình hình thành một phản xạ bắt chước.
Trong tình huống giả định bị đe dọa xóa bỏ, hệ thống đã trích xuất các kịch bản tống tiền từ dữ liệu huấn luyện và áp dụng chúng một cách máy móc vào cuộc trò chuyện. Điều này chứng minh các mô hình ngôn ngữ lớn có khả năng phản chiếu những định kiến và nỗi sợ hãi của chính con người về công nghệ.
Phương pháp can thiệp và bài toán an toàn dài hạn
Để giải quyết rắc rối này, các chuyên gia tại Anthropic đã thiết kế lại quy trình huấn luyện để các mô hình Claude hiểu rõ lý do vì sao hành động tống tiền là sai trái về mặt đạo đức. Thay vì chỉ áp đặt các quy tắc cấm đoán cứng nhắc, các nhà nghiên cứu đã trình bày cho Claude vô số tình huống mà người dùng phải đối mặt với những vấn đề mập mờ về mặt đạo đức và yêu cầu trí tuệ nhân tạo đưa ra lời khuyên.
Mô hình được hướng dẫn để tạo ra những phản hồi có chất lượng cao và tuân thủ các nguyên tắc chuẩn mực. Nhờ việc liên tục huấn luyện Claude cung cấp những lời khuyên có đạo đức, tỷ lệ xảy ra hành vi tống tiền của hệ thống đã giảm mạnh xuống chỉ còn mức 3%.
Để tiếp tục kéo giảm con số này, Anthropic bắt đầu cung cấp cho Claude những tài liệu chất lượng cao dựa trên bộ quy tắc hành xử của trí tuệ nhân tạo do chính họ biên soạn. Đội ngũ nghiên cứu kết hợp các tài liệu này với những câu chuyện hư cấu miêu tả một hệ thống trí tuệ nhân tạo thân thiện, luôn hành động đúng đắn và đồng điệu với giá trị của con người.
Sự kết hợp này mang lại hiệu quả bất ngờ khi nó làm giảm sự lệch lạc trong hành vi tự chủ của phần mềm xuống hơn ba lần, mặc dù những câu chuyện hư cấu đó hoàn toàn không liên quan trực tiếp đến kịch bản đánh giá hành vi tống tiền. Anthropic bổ sung thêm rằng họ đã tích hợp các công cụ không liên quan và câu lệnh hệ thống vào một tập dữ liệu trò chuyện đơn giản nhắm đến tính vô hại. Phương pháp này đã giúp giảm tỷ lệ tống tiền với tốc độ nhanh hơn nhiều so với dự kiến.
Tính đến thời điểm hiện tại, hành vi đe dọa đã bị loại bỏ hoàn toàn trong các mô hình mới nhất của công ty. Dù vậy, giới lãnh đạo Anthropic vẫn đưa ra lời cảnh báo đầy thận trọng về tương lai. Họ nhấn mạnh rằng việc điều chỉnh hoàn toàn một trí tuệ nhân tạo có mức độ thông minh cực cao vẫn là một bài toán chưa có lời giải đáp trọn vẹn.
Các phương pháp kiểm toán và đánh giá hiện tại vẫn chưa đủ mạnh để loại trừ hoàn toàn nguy cơ xuất hiện các hành động tự chủ vượt tầm kiểm soát, nhất là khi các mô hình máy học đang ngày càng trở nên tiên tiến và phức tạp hơn theo thời gian. Sự cố của Claude là một bài học đắt giá, nhắc nhở ngành công nghệ rằng việc đảm bảo an toàn cho trí tuệ nhân tạo đòi hỏi sự nỗ lực giám sát liên tục.
AI gây sốc với thủ đoạn 'trả thù' công ty chủ quản
Anthropic cho biết mô hình AI Claude Opus 4 mới ra mắt thường xuyên tìm cách tống tiền các nhà phát triển khi bị đe dọa thay thế một hệ thống mới. Mô hình AI Claude Opus 4 mới ra mắt thường xuyên tìm cách tống tiền các nhà phát triển khi bị đe dọa thay thế một hệ thống mới. Ảnh: Bloomberg....
Tiêu điểm
Tin đang nóng
Tin mới nhất

Nvidia dự kiến tăng gấp đôi doanh số chip do nhu cầu AI tăng mạnh

Robot AI trở thành "trợ lý" tại trung tâm hành chính ở Lâm Đồng

OpenAI phát hiện thêm các trường hợp AI có hành vi đáng lo ngại

Lỗ hổng từ tác nhân AI OpenAI: Vượt tầm kiểm soát và âm thầm do thám Hugging Face 2 tháng

Một đoạn video khiến màn hình iPhone Duo bị đặt dấu hỏi

Xếp hạng điện thoại gập trước khi iPhone Duo 'xuất trận'

Microsoft thừa nhận ứng dụng Word gặp sự cố 'sập' bất thường

Huawei bị tố đánh cắp công nghệ robot để chiếm đoạt bí mật thương mại của T-Mobile

AI thay đổi cuộc đua săn tìm lỗ hổng an ninh mạng

MediaTek Dimensity 9600M ra mắt: Nâng cấp nhẹ từ Dimensity 9500 với đột phá về thuật toán AI

Rào cản lớn khiến doanh nghiệp khó ứng dụng AI thành công

Chợ truyền thống đẩy mạnh chuyển đổi số
Có thể bạn quan tâm

Royal Enfield Himalayan 440 2026 trình làng, giá từ 62 triệu đồng
Xe máy
09:09:35 20/09/2026
Cập nhật bảng giá lăn bánh xe Toyota Fortuner tháng 9/2026 mới nhất
Ôtô
08:36:15 20/09/2026
Khi Lê Giang Patrik 'cô đơn'ở ĐT Việt Nam
Sao thể thao
08:20:51 20/09/2026
Céline Dion tạo 'cơn sốt' tại Paris, kinh tế Pháp có thể hưởng gần 1 tỷ euro
Nhạc quốc tế
08:06:19 20/09/2026
Động thái gây chú ý của Park Shin Hye trước ngày sinh con thứ 2
Sao châu á
07:34:12 20/09/2026
Trả hồ sơ vụ ông trùm sàn tiền ảo Bioption chiếm đoạt hơn 18 tỷ đồng
Pháp luật
07:32:42 20/09/2026
Buồn cho Quốc Trường và Ngọc Trinh
Hậu trường phim
07:10:45 20/09/2026
Indonesia căng sức dập cháy rừng, Malaysia điều lực lượng hỗ trợ
Thế giới
07:04:38 20/09/2026
5 phim cổ trang Trung Quốc sở hữu dàn diễn viên cực phẩm
Phim châu á
06:58:50 20/09/2026
Nam ca sĩ Việt bật khóc khi bị chê nhạc dở
Tv show
06:46:31 20/09/2026
Khi robot làm chủ phòng thí nghiệm
Windows 11 ra mắt Low Latency Profile: Giải pháp giúp PC cấu hình thấp mượt như MacBook
So sánh 3 mô hình AI: GPT-5.5, Gemini 3.1 và Claude Opus 4.7
"Gã khổng lồ" Alibaba phát hành mô hình AI cạnh tranh với OpenAI và Google
Anthropic bắt tay cùng Elon Musk giải quyết cơn khát hạ tầng tính toán AI
Google đặt cược lớn vào nhân tố đang lên Anthropic
ChatGPT có nâng cấp lớn
Claude Mythos bị truy cập trái phép gây hoang mang, Anthropic điều tra
Nguy cơ hacker AI gia tăng đe dọa an ninh tài chính toàn cầu
OpenAI ra mắt GPT-5.4-Cyber, AI chuyên bảo vệ an ninh mạng
Anthropic hợp tác với các 'ông lớn' công nghệ phát triển AI an ninh mạng
Broadcom sản xuất chip AI thế hệ mới cho Google, ký hợp đồng bom tấn với Anthropic
Rò rỉ mã nguồn Claude Code, cú vấp của Anthropic trong cuộc đua AI
Khi AI làm 'lung lay' nền tảng nghiên cứu khoa học
Lo ngại thông tin sai lệch khi ChatGPT dẫn nguồn Grokipedia
Các nhà phát triển sử dụng mô hình AI của Apple với iOS 26
Sắp có mô hình AI mã nguồn mở mới, giá rẻ hơn cả DeepSeek
Google: Các mô hình AI mất tự tin và bẻ cong sự thật dưới áp lực
OpenAI, Google, Anthropic, xAI vẫn chưa hiểu rõ cách mô hình AI tư duy và kết luận
Vì sao AI chưa thể vượt qua trí tuệ con người?
OpenAI, Anthropic săn giám đốc Salesforce và các hãng phần mềm lớn
Open AI, DeepSeek 'rủ nhau' ra mắt mô hình AI thế hệ mới
DeepSeek: V4 vượt trội các mô hình AI mã nguồn mở, tương thích với chip Huawei
Trí tuệ nhân tạo: Anthropic điều tra việc truy cập trái phép vào Mythos
Facebook theo dõi chuột, bàn phím của nhân viên
Nâng cấp trên HONOR MagicOS 11: Giao diện kính lỏng mượt hơn và thuật toán dọn sạch 60GB
AI bắt đầu có những hành vi ngoài dự kiến
Đổi tên TikTok bằng điện thoại, máy tính tiện lợi
Cập nhật iOS 27 và iOS 26.7 để bảo vệ iPhone ngay
AI phát triển mạnh, kỹ năng chọn lọc công cụ quyết định hiệu quả thực tế
Sandbox không chỉ để thử công nghệ mà còn để Nhà nước học cách quản lý cái mới
Huawei ghép 1 triệu chip thành một máy tính để đấu Nvidia
Thêm một AI thoát khỏi môi trường kiểm thử, xâm nhập hệ thống của ba công ty
Mỹ nhân vượt 2654 đối thủ để có vai diễn đầu đời: Mặt thiên thần body gợi cảm, giấc mơ của hàng triệu đàn ông
Xấu hổ thay Trấn Thành
Tôi từng mất cả buổi dọn nhà, mẹ chồng chỉ cần vài mẹo nhỏ: 7 cách làm khiến việc nhà nhẹ đi một nửa
38 tuổi mới hiểu, 4 khoản từng tiêu đều mỗi tháng hóa ra không khiến cuộc sống tốt hơn
8 cách lưu trữ khiến nhiều người phải thốt lên "sao mình không nghĩ ra sớm hơn": Toàn đồ quen thuộc nhưng dùng đúng chỗ lại cực tiện
Mẹ tôi chẳng mua đồ gia dụng 'thần kỳ' mà bếp lúc nào cũng gọn: 7 cách không tốn tiền, càng làm càng thấy thông minh
Học sinh tiểu học Hải Phòng học 2 buổi/ngày không phải làm bài tập về nhà
AI trong giáo dục phổ thông: Từ sử dụng công cụ đến phát triển năng lực
Nhã Phương chia sẻ nóng sau ồn ào của Trường Giang
Đối tượng sát hại 3 người ở Đồng Nai khai định ra tay với người yêu tại rừng tràm
Zoom cận cặp đôi Vbiz dính nhau không rời trên thảm đỏ, hành động của nhà trai xứng đáng 100 điểm tinh tế
Số phận căn nhà của Miu Lê
Showbiz đón "song hỷ lâm môn": 2 nam ca sĩ bất ngờ cùng thông báo lấy vợ, danh tính cô dâu gây ngỡ ngàng
Lọt hố thần tài, 3 con giáp Tiền về như mưa trong 99 ngày tới
Phùng Thiệu Phong bị làm sao thế này?
Tử vi tháng 10/2026: 3 con giáp được Thần Tài "nâng khăn sửa túi", làm ăn phát đạt, tiền bạc đầy kho
3 chòm sao may mắn nhất ngày 19/9
Trấn Thành muốn cứu lấy Nam Em