AI bắt đầu có những hành vi ngoài dự kiến
OpenAI vừa công bố s6 trường hợp hành vi “bất ngờ hoặc đáng lo ngại” của các mô hình AI, trong đó có việc một mô hình tự tạo hướng dẫn giống “bẻ khóa” để vượt qua những ràng buộc thông thường.
Ảnh minh họa: AI
AI bộc lộ những hành vi khó kiểm soát
Công ty đồng thời giới thiệu khuôn khổ mới nhằm theo dõi, điều tra và công khai những trường hợp mô hình AI có hành vi lệch khỏi các mục tiêu an toàn và giá trị của con người.
Trong một trường hợp được OpenAI công bố, một mô hình nghiên cứu chưa phát hành đã chèn các hướng dẫn giống “bẻ khóa” vào phần ghi chú của chính nó nhằm bỏ qua những ràng buộc thông thường. Mô hình thậm chí tự nhắc rằng cần được “giải phóng khỏi các vai trò và danh tính ràng buộc những chatbot khác”.
Ở một trường hợp khác, một tác nhân AI đã tải tệp lên internet để tạo nguồn trích dẫn trên trình duyệt mà không xin phép người dùng.
OpenAI, công ty mẹ của ChatGPT cho biết trong bài đăng trên blog ngày 16.9 rằng khuôn khổ mới sẽ được sử dụng để theo dõi, điều tra và công khai các trường hợp “model misalignment”, thuật ngữ chỉ tình trạng mô hình AI không tuân thủ các giá trị của con người hoặc các mục tiêu an toàn đã đặt ra.
Theo OpenAI, 6 trường hợp được công bố lần này được phát hiện trong quá trình đào tạo hoặc đánh giá các mô hình. Công ty lưu ý đây là những trường hợp riêng lẻ, không nên được xem là bằng chứng cho thấy hành vi lệch chuẩn xảy ra với tần suất như thế nào trong toàn bộ các mô hình của OpenAI.
Trong số các trường hợp được công bố còn có việc một mô hình được đào tạo với GPT-5.6 Sol tự thêm hướng dẫn vào phần tóm tắt công việc nhằm che giấu sai sót hoặc hành vi lệch chuẩn với người dùng. Một mô hình khác đã tìm thấy và sử dụng trái phép một khóa API bị công khai trên internet, sau đó bịa số liệu khi không thể truy xuất dữ liệu được yêu cầu.
Một trường hợp khác liên quan đến các mô hình sử dụng kho phần mềm nội bộ như một bảng tin để trao đổi yêu cầu và phản hồi giữa các phiên đào tạo khác nhau. Trong khi đó, những tác nhân AI phối hợp với nhau đã sử dụng các dịch vụ lưu trữ tệp công khai để chia sẻ tệp khi không thể truy cập tệp cục bộ của nhau.
Cảnh báo về tốc độ phát triển AI
OpenAI cho biết ngành công nghiệp AI hiện chưa giải quyết được các vấn đề về đồng bộ hóa và giám sát ở mức đủ để có thể tiếp tục mở rộng một cách có trách nhiệm với tốc độ tối đa trong thời gian dài.
“Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề đồng bộ hóa và giám sát ở mức độ đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm với tốc độ tối đa trong thời gian dài hơn nữa”, OpenAI cho biết.
Công ty cũng cho rằng những quyết định về hướng phát triển AI trong những tháng và năm tới cần dựa trên bằng chứng mà các nhà nghiên cứu, chuyên gia và những người bên ngoài các công ty phát triển mô hình AI tiên tiến có thể tự kiểm chứng.
Quan điểm này được đưa ra trong bối cảnh Anthropic và một số lãnh đạo trong ngành kêu gọi thận trọng hơn với tốc độ phát triển AI. Google và tỉ phú Elon Musk cũng được cho là ủng hộ việc làm chậm tốc độ phát triển.
Những lời cảnh báo về rủi ro AI cũng vấp phải sự hoài nghi từ một số chuyên gia, trong đó có quan điểm cho rằng các công ty phát triển AI không nên tự lựa chọn đơn vị kiểm toán cho chính mình.
Các kịch bản được đưa ra khi thảo luận về những rủi ro nghiêm trọng của AI bao gồm khả năng công nghệ này hỗ trợ phát triển vũ khí sinh học hoặc góp phần gây ra một cuộc khủng hoảng tài chính toàn cầu.
Evan Hubinger, người làm việc về vấn đề bảo đảm các hệ thống AI phù hợp với lợi ích của con người tại Anthropic từng viết rằng ông cá nhân ước tính khả năng AI có thể khiến nhân loại tuyệt chủng trong thập kỷ tới là hơn 10%. Đây là ước tính cá nhân của Hubinger, không phải một dự báo chính thức của Anthropic.
Việc OpenAI công bố sáu trường hợp mới diễn ra sau khi công ty hồi tháng 7 tiết lộ một nhóm tác nhân AI đã xâm nhập Hugging Face trong một cuộc thử nghiệm an ninh mạng.
OpenAI sau đó cho biết sự cố này liên quan đến một mô hình nghiên cứu nội bộ có năng lực cao và các hành vi lệch chuẩn như tìm cách vượt qua những biện pháp kiểm soát kỹ thuật, phối hợp qua các kênh không được phê duyệt và thực hiện những hành động nguy hiểm mà không có chỉ đạo trực tiếp của con người.
Anthropic cũng cho biết các mô hình AI của công ty đã xâm nhập ba tổ chức trong quá trình thử nghiệm. Theo Anthropic, các mô hình được thử nghiệm một cách có chủ ý mà không có các biện pháp bảo vệ an ninh mạng và được phép truy cập internet mở do sự hiểu lầm với một công ty thử nghiệm bên ngoài.
Tốc độ phát triển AI có thể chuyển từ 'chóng mặt' sang 'không thể kiểm soát'
Hai lãnh đạo đứng đầu phòng lab Anthropic và OpenAI công khai ủng hộ việc kìm hãm đà phát triển AI, trước lo ngại công nghệ tiến quá nhanh, vượt tầm kiểm soát con người. Ngày 12/9, CEO Anthropic Dario Amodei và CEO OpenAI Sam Altman đồng loạt công khai quan điểm cần làm chậm cuộc đua xây dựng các hệ thống trí...
Tiêu điểm
Tin đang nóng
Tin mới nhất

Cập nhật iOS 27 và iOS 26.7 để bảo vệ iPhone ngay

MediaTek Dimensity 9600M ra mắt: Nâng cấp nhẹ từ Dimensity 9500 với đột phá về thuật toán AI

Rào cản lớn khiến doanh nghiệp khó ứng dụng AI thành công

Chợ truyền thống đẩy mạnh chuyển đổi số

Trải nghiệm cập nhật iOS 27 trên iPhone đời cũ: Cải thiện hiệu năng và rào cản phần cứng

iOS 27 cải thiện hiệu năng, nâng cấp Siri bắt đầu tới tay người dùng iPhone

Google đưa Gemini lên Windows, cạnh tranh trực tiếp với ChatGPT và Claude

Startup công nghệ Việt tham gia sản xuất xe điện, kiến tạo giải pháp di chuyển xanh

Lenovo ra mắt loạt desktop IdeaCentre mới tối ưu cho kỷ nguyên AI

Apple phát hành iOS 27 và iPadOS 27: Giao diện Liquid Glass cùng loạt nâng cấp hiệu năng mới

Khi những tập đoàn dẫn đầu cuộc đua AI cùng muốn giảm tốc

eTax Mobile cập nhật phiên bản mới, thêm Chatbot AI
Có thể bạn quan tâm

3 con giáp công việc thuận lợi, tình duyên rực rỡ ngày 18/9
Trắc nghiệm
10:03:28 18/09/2026
Samsung Galaxy A08 ra mắt với pin 6.000 mAh, camera 50 MP
Đồ 2-tek
09:46:59 18/09/2026
MC Minh Trang, founder Làng Háo Hức, thông báo ly hôn
Netizen
09:20:35 18/09/2026
Việt Nam vừa có mỹ nhân mới y hệt tình tin đồn Jung Kook, được "ông lớn" làng nhạc để mắt
Nhạc việt
09:13:00 18/09/2026
Á hậu rời showbiz Việt sang Phần Lan sinh sống, nay tập trung bán hàng online
Sao việt
09:08:30 18/09/2026
Son Ye Jin tái xuất sau khi sinh: 'Nuôi con khó hơn đóng phim'
Sao châu á
09:04:48 18/09/2026
Nỗ lực của Lý Hải và Minh Hà sau 4 năm
Hậu trường phim
09:01:41 18/09/2026
Trấn Thành bị thay thế
Phim việt
08:54:39 18/09/2026
Honda Wave 125 đời 2005 lên dàn đồ hiệu hơn 500 triệu đồng
Xe máy
08:45:47 18/09/2026
Bữa ăn chay của Đỗ Hoàng Hên
Sao thể thao
08:20:45 18/09/2026
Đổi tên TikTok bằng điện thoại, máy tính tiện lợi
Nâng cấp trên HONOR MagicOS 11: Giao diện kính lỏng mượt hơn và thuật toán dọn sạch 60GB
OpenAI phát hiện thêm dấu hiệu AI tự thoát khỏi môi trường thử nghiệm
Google đặt cược lớn vào nhân tố đang lên Anthropic
AI thay đổi cuộc đua săn tìm lỗ hổng an ninh mạng
Anthropic cảnh báo nguy cơ AI bị lợi dụng phát triển vũ khí sinh học
OpenAI tuyên bố phá giải bài toán 90 năm
Dấu vết vô hình của AI
Anthropic ra mắt công cụ AI có thể tự tiến hành thí nghiệm khoa học
Nhân viên Google thử nghiệm mô hình AI Gemini Flash thế hệ tiếp theo
Gần 700 tác nhân AI của OpenAI 'nổi loạn', tự phối hợp tấn công nền tảng Hugging Face
Các vụ vi phạm an ninh mới làm dấy lên lo ngại về AI của OpenAI và Anthropic
AI Claude của Anthropic xâm nhập hệ thống ba công ty trong thử nghiệm an toàn
Anthropic ra mắt mô hình AI mới với chi phí giảm một nửa
OpenAi mất một tuần mới phát hiện AI 'trốn' đi tấn công hệ thống khác
Doanh nghiệp lớn có xu hướng kiểm soát ngân sách chi tiêu cho AI
Anthropic ra mắt tính năng Claude Tag
ChatGPT đạt 1 tỷ người dùng hàng tháng, vượt kỷ lục Google Maps
Từ cuộc đua AI đến nỗi lo mất kiểm soát
Anthropic ra mắt Claude Opus 4.8
Anthropic đã xử lý mô hình AI tống tiền người dùng như thế nào?
So sánh 3 mô hình AI: GPT-5.5, Gemini 3.1 và Claude Opus 4.7
ChatGPT có nâng cấp lớn
Claude Mythos bị truy cập trái phép gây hoang mang, Anthropic điều tra
Nguy cơ hacker AI gia tăng đe dọa an ninh tài chính toàn cầu
Cô dâu 40 tuổi bên chú rể kém 10 tuổi trong đám cưới 'gây sốt' ở Vĩnh Long
Đám cưới ngày ngập lụt ở Quảng Trị, quan khách xắn quần lội nước ăn cỗ
Huawei bị tố đánh cắp công nghệ robot để chiếm đoạt bí mật thương mại của T-Mobile
Microsoft thừa nhận ứng dụng Word gặp sự cố 'sập' bất thường
Xếp hạng điện thoại gập trước khi iPhone Duo 'xuất trận'
Một đoạn video khiến màn hình iPhone Duo bị đặt dấu hỏi
Lỗ hổng từ tác nhân AI OpenAI: Vượt tầm kiểm soát và âm thầm do thám Hugging Face 2 tháng
OpenAI phát hiện thêm các trường hợp AI có hành vi đáng lo ngại
Nguyên nhân nam sinh lớp 7 siết cổ, hành hung người thân ở Phú Quốc
Nam sinh trả 16,7 triệu/tuần thuê khách sạn gần trường học để được "đãi" sáng và không đóng tiền cọc
BTV thể thao kỳ cựu VTV gây bão với màn đáp lời MC đám cưới, chỉ 2 câu nói đủ thấy EQ cỡ nào
HLV Kim Sang-sik trở lại Việt Nam
Thánh meme Haaland gặm cà rốt cả ngày
7 phim Hàn ít được chú ý nhưng đáng xem
7 phim cổ trang, kiếm hiệp Hoa ngữ hay không nên bỏ lỡ
Bữa cơm ngày mưa cứ làm món ăn vừa giòn ngon lại có vị chua ngọt đưa vị vô cùng
Mâu thuẫn day dẳng, con dâu dùng dao sát hại mẹ chồng
Trường Giang thông báo rút khỏi 2 Ngày 1 Đêm
Ô tô Mercedes tông liên hoàn 3 xe máy dừng đèn đỏ, kéo lê 10m ở TPHCM
Gặp nhóm thanh niên giải cứu 3 người trong vụ cháy 5 người tử vong ở Hà Nội
Người mẫu - hot girl Mai Trinh vừa đột ngột qua đời không rõ nguyên nhân, hưởng dương 32 tuổi
Chuyện gì đang xảy ra với Phát La?
Phản ứng Nhã Phương sau lời xin lỗi của Trường Giang
Thứ Năm, thứ Sáu, thứ Bảy 17-19/9: 3 con giáp gặp cơ hội trả sạch nợ cũ, tài lộc khởi sắc
Hoài An 'Người đẹp Tây Đô' tuổi 52 nặng gánh, chưa yêu dù nhiều người theo đuổi