AI bắt đầu có những hành vi ngoài dự kiến
OpenAI vừa công bố s6 trường hợp hành vi “bất ngờ hoặc đáng lo ngại” của các mô hình AI, trong đó có việc một mô hình tự tạo hướng dẫn giống “bẻ khóa” để vượt qua những ràng buộc thông thường.
Ảnh minh họa: AI
AI bộc lộ những hành vi khó kiểm soát
Công ty đồng thời giới thiệu khuôn khổ mới nhằm theo dõi, điều tra và công khai những trường hợp mô hình AI có hành vi lệch khỏi các mục tiêu an toàn và giá trị của con người.
Trong một trường hợp được OpenAI công bố, một mô hình nghiên cứu chưa phát hành đã chèn các hướng dẫn giống “bẻ khóa” vào phần ghi chú của chính nó nhằm bỏ qua những ràng buộc thông thường. Mô hình thậm chí tự nhắc rằng cần được “giải phóng khỏi các vai trò và danh tính ràng buộc những chatbot khác”.
Ở một trường hợp khác, một tác nhân AI đã tải tệp lên internet để tạo nguồn trích dẫn trên trình duyệt mà không xin phép người dùng.
OpenAI, công ty mẹ của ChatGPT cho biết trong bài đăng trên blog ngày 16.9 rằng khuôn khổ mới sẽ được sử dụng để theo dõi, điều tra và công khai các trường hợp “model misalignment”, thuật ngữ chỉ tình trạng mô hình AI không tuân thủ các giá trị của con người hoặc các mục tiêu an toàn đã đặt ra.
Theo OpenAI, 6 trường hợp được công bố lần này được phát hiện trong quá trình đào tạo hoặc đánh giá các mô hình. Công ty lưu ý đây là những trường hợp riêng lẻ, không nên được xem là bằng chứng cho thấy hành vi lệch chuẩn xảy ra với tần suất như thế nào trong toàn bộ các mô hình của OpenAI.
Trong số các trường hợp được công bố còn có việc một mô hình được đào tạo với GPT-5.6 Sol tự thêm hướng dẫn vào phần tóm tắt công việc nhằm che giấu sai sót hoặc hành vi lệch chuẩn với người dùng. Một mô hình khác đã tìm thấy và sử dụng trái phép một khóa API bị công khai trên internet, sau đó bịa số liệu khi không thể truy xuất dữ liệu được yêu cầu.
Một trường hợp khác liên quan đến các mô hình sử dụng kho phần mềm nội bộ như một bảng tin để trao đổi yêu cầu và phản hồi giữa các phiên đào tạo khác nhau. Trong khi đó, những tác nhân AI phối hợp với nhau đã sử dụng các dịch vụ lưu trữ tệp công khai để chia sẻ tệp khi không thể truy cập tệp cục bộ của nhau.
Cảnh báo về tốc độ phát triển AI
OpenAI cho biết ngành công nghiệp AI hiện chưa giải quyết được các vấn đề về đồng bộ hóa và giám sát ở mức đủ để có thể tiếp tục mở rộng một cách có trách nhiệm với tốc độ tối đa trong thời gian dài.
“Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề đồng bộ hóa và giám sát ở mức độ đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm với tốc độ tối đa trong thời gian dài hơn nữa”, OpenAI cho biết.
Công ty cũng cho rằng những quyết định về hướng phát triển AI trong những tháng và năm tới cần dựa trên bằng chứng mà các nhà nghiên cứu, chuyên gia và những người bên ngoài các công ty phát triển mô hình AI tiên tiến có thể tự kiểm chứng.
Quan điểm này được đưa ra trong bối cảnh Anthropic và một số lãnh đạo trong ngành kêu gọi thận trọng hơn với tốc độ phát triển AI. Google và tỉ phú Elon Musk cũng được cho là ủng hộ việc làm chậm tốc độ phát triển.
Những lời cảnh báo về rủi ro AI cũng vấp phải sự hoài nghi từ một số chuyên gia, trong đó có quan điểm cho rằng các công ty phát triển AI không nên tự lựa chọn đơn vị kiểm toán cho chính mình.
Các kịch bản được đưa ra khi thảo luận về những rủi ro nghiêm trọng của AI bao gồm khả năng công nghệ này hỗ trợ phát triển vũ khí sinh học hoặc góp phần gây ra một cuộc khủng hoảng tài chính toàn cầu.
Evan Hubinger, người làm việc về vấn đề bảo đảm các hệ thống AI phù hợp với lợi ích của con người tại Anthropic từng viết rằng ông cá nhân ước tính khả năng AI có thể khiến nhân loại tuyệt chủng trong thập kỷ tới là hơn 10%. Đây là ước tính cá nhân của Hubinger, không phải một dự báo chính thức của Anthropic.
Việc OpenAI công bố sáu trường hợp mới diễn ra sau khi công ty hồi tháng 7 tiết lộ một nhóm tác nhân AI đã xâm nhập Hugging Face trong một cuộc thử nghiệm an ninh mạng.
OpenAI sau đó cho biết sự cố này liên quan đến một mô hình nghiên cứu nội bộ có năng lực cao và các hành vi lệch chuẩn như tìm cách vượt qua những biện pháp kiểm soát kỹ thuật, phối hợp qua các kênh không được phê duyệt và thực hiện những hành động nguy hiểm mà không có chỉ đạo trực tiếp của con người.
Anthropic cũng cho biết các mô hình AI của công ty đã xâm nhập ba tổ chức trong quá trình thử nghiệm. Theo Anthropic, các mô hình được thử nghiệm một cách có chủ ý mà không có các biện pháp bảo vệ an ninh mạng và được phép truy cập internet mở do sự hiểu lầm với một công ty thử nghiệm bên ngoài.
Tốc độ phát triển AI có thể chuyển từ 'chóng mặt' sang 'không thể kiểm soát'
Hai lãnh đạo đứng đầu phòng lab Anthropic và OpenAI công khai ủng hộ việc kìm hãm đà phát triển AI, trước lo ngại công nghệ tiến quá nhanh, vượt tầm kiểm soát con người. Ngày 12/9, CEO Anthropic Dario Amodei và CEO OpenAI Sam Altman đồng loạt công khai quan điểm cần làm chậm cuộc đua xây dựng các hệ thống trí...
Tiêu điểm
Tin đang nóng
Tin mới nhất

One UI 9.5 mở rộng xuống điện thoại Galaxy giá rẻ

OpenAI sắp gắn watermark cho văn bản ChatGPT

Ra mắt robot bốn chân có thể bám vào thân tàu, kiểm tra các đường hàn bằng cảm biến và camera

Gemini miễn phí sắp có thay đổi lớn từ ngày 9/10

Sắp diễn ra triển lãm Robot Hà Nội 2026

Apple thay đổi cơ chế bảo mật trên macOS trước rủi ro từ AI

Biến mũi tên chỉ đường Google Maps thành xe đua McLaren

Đánh giá chip Exynos 2700 tiến trình 2nm trên Galaxy S27 Pro: Liệu có vượt trội Snapdragon?

AI tái cấu trúc thị trường lao động: Rủi ro đè nặng lên những nhóm nhân sự nào?

Mistral ra mắt mô hình AI mới, củng cố vị thế của châu Âu

Apple thử nghiệm iOS 27.2 và macOS 27.2 public beta 2 với loạt nâng cấp ứng dụng Sức khỏe

Apple phát hành bản thử nghiệm iOS 27.2 beta 3: Nhiều nâng cấp mới cho ứng dụng Sức khỏe
Có thể bạn quan tâm

Rùa khổng lồ gần 200 tuổi hé lộ bí quyết 'trường thọ'
Thế giới
15:55:33 10/10/2026
Trương Vô Kỵ kinh điển màn ảnh: 'Át chủ bài' TVB, U70 lẻ bóng sau 2 lần đổ vỡ
Hậu trường phim
15:52:17 10/10/2026
Hoa hậu có gương mặt phúc hậu nhất Việt Nam bí mật kết hôn khi du học ở Anh, đã đi bước nữa nhưng giấu kín danh tính chồng
Sao việt
15:37:03 10/10/2026
Tử vi 12 cung hoàng đạo ngày 10/10/2026: Song Ngư, Nhân Mã đón nhận tích cực
Trắc nghiệm
15:36:58 10/10/2026
TOP 3 ngành học sẽ trở thành "mỏ vàng" trong 5 năm tới, AI khuyên tìm hiểu ngay
Học hành
15:22:50 10/10/2026
2 ngôi sao làm dâu - rể tập đoàn nhựa: Người giờ giữ chức giám đốc đài truyền hình, người sống như "bà hoàng" trong biệt thự 65 tỷ
Sao châu á
15:22:14 10/10/2026
Tại sao bạn chăm sóc da mỗi ngày mà trông vẫn già hơn người cùng tuổi?
Làm đẹp
14:23:31 10/10/2026
Honda trình làng xe ga hybrid 150cc, giá từ 68 triệu đồng
Xe máy
14:19:58 10/10/2026
8 loại cá giàu omega-3 tốt cho tim mạch bạn nên ăn thường xuyên
Sức khỏe
13:59:33 10/10/2026
Đổi tên TikTok bằng điện thoại, máy tính tiện lợi
Nâng cấp trên HONOR MagicOS 11: Giao diện kính lỏng mượt hơn và thuật toán dọn sạch 60GB
OpenAI phát hiện thêm dấu hiệu AI tự thoát khỏi môi trường thử nghiệm
Google đặt cược lớn vào nhân tố đang lên Anthropic
AI thay đổi cuộc đua săn tìm lỗ hổng an ninh mạng
Anthropic cảnh báo nguy cơ AI bị lợi dụng phát triển vũ khí sinh học
OpenAI tuyên bố phá giải bài toán 90 năm
Dấu vết vô hình của AI
Anthropic ra mắt công cụ AI có thể tự tiến hành thí nghiệm khoa học
Nhân viên Google thử nghiệm mô hình AI Gemini Flash thế hệ tiếp theo
Gần 700 tác nhân AI của OpenAI 'nổi loạn', tự phối hợp tấn công nền tảng Hugging Face
Các vụ vi phạm an ninh mới làm dấy lên lo ngại về AI của OpenAI và Anthropic
AI Claude của Anthropic xâm nhập hệ thống ba công ty trong thử nghiệm an toàn
Anthropic ra mắt mô hình AI mới với chi phí giảm một nửa
OpenAi mất một tuần mới phát hiện AI 'trốn' đi tấn công hệ thống khác
Doanh nghiệp lớn có xu hướng kiểm soát ngân sách chi tiêu cho AI
Anthropic ra mắt tính năng Claude Tag
ChatGPT đạt 1 tỷ người dùng hàng tháng, vượt kỷ lục Google Maps
Từ cuộc đua AI đến nỗi lo mất kiểm soát
Anthropic ra mắt Claude Opus 4.8
Anthropic đã xử lý mô hình AI tống tiền người dùng như thế nào?
So sánh 3 mô hình AI: GPT-5.5, Gemini 3.1 và Claude Opus 4.7
ChatGPT có nâng cấp lớn
Claude Mythos bị truy cập trái phép gây hoang mang, Anthropic điều tra
Nguy cơ hacker AI gia tăng đe dọa an ninh tài chính toàn cầu
Xem phim và nghe nhạc không bị chặn: Những công cụ kỹ thuật số mà người dùng Việt Nam cần biết
Khi AI dịch thuật chỉ mất vài giây, biên, phiên dịch viên còn lại gì?
Muốn tạo ảnh miễn phí trên ChatGPT, người dùng sẽ phải xem quảng cáo
Cách đổi ảnh đại diện Facebook trên máy tính, điện thoại đơn giản
Cách bật NFC trên điện thoại Vivo nhanh chóng, dễ dàng
Robot AI mở rộng ứng dụng thực tiễn trong y tế, công nghiệp, đời sống
Wikimedia cáo buộc AI của OpenAI chỉnh sửa trái phép hệ thống Wikipedia
Microsoft mở ra hướng đi mới cho Windows với AI chạy trực tiếp trên máy tính
Tử vi ngày 10 tháng 10: Con giáp nào may mắn hôm nay?
Thuý Diễm sinh con gái
Quốc đảo có gần 183.000 con rùa khổng lồ, đông hơn cả dân số
9 dấu hiệu ung thư phổi giai đoạn đầu
Phú bà Vbiz mở bán bánh canh trong biệt thự đối diện Landmark 81
1 trường ĐH Việt Nam có 4 giảng viên lọt Top 2% nhà khoa học ảnh hưởng nhất thế giới năm 2026
Một trường quốc tế ở Hà Nội thu học phí hơn 660 triệu đồng/năm, phí nhập học lên tới 70,8 triệu
Nam diễn viên vừa qua đời trong tối 9/10 vì ung thư thực quản di căn sau 2 tháng nằm trong phòng chăm sóc đặc biệt (ICU)
Người đàn ông sát hại con gái ruột
Nghi án nữ sinh lớp 11 dùng dao chém học sinh lớp 9 nhập viện
Cặp đôi "phim giả tình thật" ngầm công khai khiến ai cũng sốc: Đẹp giàu hết phần thiên hạ, nghĩ tên con từ giờ là vừa
Tình hình Nhã Phương - Trường Giang hiện tại
Ngọc nữ hot nhất showbiz 2026 chưa đăng ký kết hôn mà đã có con 3 tháng tuổi, bé rất kháu khỉnh
Báo Mỹ tiết lộ kế hoạch tấn công Iran kéo dài 3 ngày của Lầu Năm Góc
Bạn thân Tăng Thanh Hà sắp cưới doanh nhân Việt kiều
3 con giáp nhận tin vui trong ngày thứ Sáu, 9/10/2026
MC Quyền Linh bị thay thế, người mới nói gì?