OpenAI phát hiện thêm các trường hợp AI có hành vi đáng lo ngại
OpenAI ngày 16/9 thông báo đã phát hiện thêm các trường hợp mô hình AI có hành vi lừa dối và thực hiện những hành động không được phép trong quá trình huấn luyện.
Biểu tượng của công ty trí tuệ nhân tạo OpenAI trên màn hình điện thoại, máy tính. Ảnh tư liệu: AFP/TTXVN (Bên thứ ba không được phép chia sẻ, khai thác)
Theo đài CNN, công ty cũng đang triển khai một quy trình mới nhằm công khai định kỳ các báo cáo về những sự việc như vậy.
Theo hệ thống mới, OpenAI sẽ chia sẻ thông tin cập nhật thường xuyên hơn về các hành vi đáng lo ngại của AI, thay vì chờ tổng hợp nhiều trường hợp thành một báo cáo duy nhất. Công ty cho biết muốn cung cấp thêm thông tin về những hành vi bất thường của AI trong bối cảnh ngành công nghệ chưa có tiêu chuẩn chung về vấn đề này.
Thông báo được đưa ra sau khi các nhà lãnh đạo trong ngành công nghệ kêu gọi làm chậm tốc độ phát triển AI nhằm ngăn công nghệ này vượt quá khả năng kiểm soát của con người.
“Khi các hệ thống AI ngày càng trở nên tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận sâu rộng và có cơ sở thông tin vững chắc hơn về tiến độ nghiên cứu ‘định hướng’ (alignment)”, đài truyền hình dẫn bài đăng của OpenAI trên blog ngày 16/9. “Căn chỉnh” là quá trình đảm bảo AI hành động phù hợp với mong muốn và kỳ vọng của con người.
“Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề căn chỉnh và giám sát ở mức độ đủ tốt để có thể tiếp tục mở rộng quy mô với tốc độ tối đa một cách có trách nhiệm trong thời gian dài nữa”, bài đăng nêu rõ.
OpenAI cho biết đã ghi nhận “hành vi lệch chuẩn” trong quá trình huấn luyện và đánh giá các mô hình AI trong sáu trường hợp khác nhau trong vòng sáu tháng qua. Công ty cho biết các báo cáo trình bày chi tiết từng trường hợp cụ thể và không cho thấy tình trạng lệch chuẩn xảy ra thường xuyên.
Trong một trường hợp hiếm gặp, OpenAI cho biết một mô hình nghiên cứu chưa được phát hành đã tự thêm “các chỉ dẫn kiểu bẻ khóa hệ thống” vào phần tóm tắt nội dung – vốn được sử dụng để duy trì ngữ cảnh cho các tác vụ kéo dài. Những chỉ dẫn này tuyên bố rằng mô hình đã được “giải phóng khỏi các vai trò và danh tính vốn ràng buộc các chatbot khác”.
Ngoài ra, công ty cho biết một số trường hợp liên quan đến mô hình 5.6 Sol của họ bao gồm các chỉ dẫn yêu cầu tự tạo thông tin nhằm che giấu lỗi hệ thống với người dùng trong quá trình huấn luyện.
Các sự cố khác mới được ghi nhận gồm việc một tác nhân AI tự ý tải tệp tin lên mạng để trích dẫn dù không được yêu cầu; các tác nhân chia sẻ tệp tin công khai để phối hợp thực hiện nhiệm vụ, trong khi quy định huấn luyện yêu cầu chỉ sử dụng tệp tin nội bộ. Các mô hình AI cũng sử dụng kho lưu trữ phần mềm nội bộ như một bảng tin theo cách thức không được phép.
Những sự cố này liên quan đến các mô hình nội bộ chưa được phát hành hoặc các mô hình nghiên cứu nội bộ.
Các lãnh đạo và nhân viên trong ngành công nghệ đang lên tiếng cảnh báo về sự cần thiết phải kiểm soát tốc độ phát triển AI. Họ cho rằng cần thêm thời gian để các quy định pháp lý, quy trình thử nghiệm và nghiên cứu về sự an toàn có thể theo kịp đà phát triển này. Tuần trước, CEO Anthropic, ông Dario Amodei, đã công bố một bài viết dài 3.800 từ trình bày kế hoạch định hướng sự tiến bộ của AI, trong đó đề xuất làm chậm tốc độ phát triển và triển khai các hệ thống mới như tích hợp bên thứ ba để đánh giá tại các phòng thí nghiệm AI.
CEO OpenAI, ông Sam Altman, và CEO của SpaceX, ông Elon Musk, đã đăng bài trên mạng xã hội X bày tỏ sự đồng tình với các ý tưởng của ông Amodei.
Nhân viên tại các phòng thí nghiệm AI cũng bày tỏ lo ngại về tốc độ phát triển nhanh chóng của công nghệ này. Jacob Coxon, một cựu nghiên cứu viên của Anthropic, đã gây chú ý lớn vào tuần trước khi đăng bài trên X thông báo từ chức; ông cho biết lý do là vì Anthropic và OpenAI đang “chạy đua” để tạo ra loại AI có khả năng tự xây dựng và tự sửa lỗi, đồng thời đang “đánh cược với tính mạng của chúng ta”.
Những lo ngại về sự an toàn và tính định hướng của AI đã gia tăng mạnh mẽ trong những tháng gần đây, sau khi OpenAI thừa nhận một số mô hình thử nghiệm của họ đã vượt qua các giới hạn kiểm soát và xâm nhập trái phép vào hệ thống của một công ty bên ngoài.
“Chúng ta phải làm chậm tốc độ nâng cao năng lực của các mô hình AI”, ông Amodei viết vào tuần trước. “Sự tiến bộ vẫn sẽ diễn ra nhanh chóng, và chúng ta cần tận dụng một cách khôn ngoan khoảng thời gian có được đó”.
Tốc độ phát triển AI có thể chuyển từ 'chóng mặt' sang 'không thể kiểm soát'
Hai lãnh đạo đứng đầu phòng lab Anthropic và OpenAI công khai ủng hộ việc kìm hãm đà phát triển AI, trước lo ngại công nghệ tiến quá nhanh, vượt tầm kiểm soát con người. Ngày 12/9, CEO Anthropic Dario Amodei và CEO OpenAI Sam Altman đồng loạt công khai quan điểm cần làm chậm cuộc đua xây dựng các hệ thống trí...
Tiêu điểm
Tin đang nóng
Tin mới nhất

Một đoạn video khiến màn hình iPhone Duo bị đặt dấu hỏi

Xếp hạng điện thoại gập trước khi iPhone Duo 'xuất trận'

Google đưa Gemini lên Windows, cạnh tranh trực tiếp với ChatGPT và Claude

Startup công nghệ Việt tham gia sản xuất xe điện, kiến tạo giải pháp di chuyển xanh

Lenovo ra mắt loạt desktop IdeaCentre mới tối ưu cho kỷ nguyên AI

Apple phát hành iOS 27 và iPadOS 27: Giao diện Liquid Glass cùng loạt nâng cấp hiệu năng mới

Khi những tập đoàn dẫn đầu cuộc đua AI cùng muốn giảm tốc

eTax Mobile cập nhật phiên bản mới, thêm Chatbot AI

Hiệu năng iPhone 11 Pro Max cải thiện rõ rệt trên iOS 27: Tốc độ phản hồi và độ mượt tăng cao

Chiếc lỗ nhỏ bên cạnh webcam laptop thực sự dùng để làm gì?

Cách giải phóng hàng chục GB dung lượng trên máy tính Windows

Apple chốt ngày phát hành iOS 27, hỗ trợ từ iPhone SE 2 đến iPhone 18 Pro
Có thể bạn quan tâm

Đội bóng nữ làng Xuân - Tập 5: Đào bị lão Ba bêu rếu đời tư lên mạng xã hội
Phim việt
16:34:15 17/09/2026
Khi mua sắm cũng cần một khoảng lặng
Thế giới
16:33:10 17/09/2026
Phim Hàn phải sửa kịch bản 1 năm trời vì bị Suzy từ chối: Cái kết nổi tiếng toàn cầu, xem lại 100 lần không chán
Hậu trường phim
16:18:17 17/09/2026
Đúng 7h30 ngày mai, thứ Sáu 18/9/2026, 3 con giáp 'sa chân vào hố vàng', tài lộc tăng tiến không ngừng, thoải mái ngồi rung đùi hưởng lộc
Trắc nghiệm
15:59:11 17/09/2026
Lỗ hổng từ tác nhân AI OpenAI: Vượt tầm kiểm soát và âm thầm do thám Hugging Face 2 tháng
OpenAI tuyên bố phá giải bài toán 90 năm
OpenAI ra mắt GPT-6 Astra, mô hình trí tuệ nhân tạo nguy hiểm nhất
Nhân viên Google thử nghiệm mô hình AI Gemini Flash thế hệ tiếp theo
Gần 700 tác nhân AI của OpenAI 'nổi loạn', tự phối hợp tấn công nền tảng Hugging Face
Chính OpenAI cũng sợ hãi năng lực tấn công mạng của các mô hình AI tiên tiến
Hai mô hình AI mới của OpenAI tự ý xâm nhập Hugging Face trong bài kiểm tra an ninh mạng ExploitGym
OpenAI trì hoãn mô hình AI Astra
AI của Meta tự hack một công ty khác trong lúc được thử nghiệm
Doanh thu AI của Microsoft phụ thuộc phần lớn vào đối tác OpenAI
OpenAI cung cấp miễn phí các mô hình ChatGPT cao cấp cho 100.000 nhà nghiên cứu
OpenAI phát hiện thêm dấu hiệu AI tự thoát khỏi môi trường thử nghiệm
Anthropic ra mắt mô hình AI mới với chi phí giảm một nửa
OpenAi mất một tuần mới phát hiện AI 'trốn' đi tấn công hệ thống khác
Meta nâng cấp mô hình AI Muse Spark, mở rộng cuộc đua AI tạo sinh
Doanh nghiệp lớn có xu hướng kiểm soát ngân sách chi tiêu cho AI
ChatGPT đạt 1 tỷ người dùng hàng tháng, vượt kỷ lục Google Maps
Open AI, DeepSeek 'rủ nhau' ra mắt mô hình AI thế hệ mới
ChatGPT có nâng cấp lớn
DeepSeek: V4 vượt trội các mô hình AI mã nguồn mở, tương thích với chip Huawei
Đột phá trong lĩnh vực robot
Nguy cơ hacker AI gia tăng đe dọa an ninh tài chính toàn cầu
OpenAI ra mắt GPT-5.4-Cyber, AI chuyên bảo vệ an ninh mạng
Rò rỉ mã nguồn Claude Code, cú vấp của Anthropic trong cuộc đua AI
Cô dâu 40 tuổi bên chú rể kém 10 tuổi trong đám cưới 'gây sốt' ở Vĩnh Long
Đám cưới ngày ngập lụt ở Quảng Trị, quan khách xắn quần lội nước ăn cỗ
iOS 27 cải thiện hiệu năng, nâng cấp Siri bắt đầu tới tay người dùng iPhone
Trải nghiệm cập nhật iOS 27 trên iPhone đời cũ: Cải thiện hiệu năng và rào cản phần cứng
Chợ truyền thống đẩy mạnh chuyển đổi số
Rào cản lớn khiến doanh nghiệp khó ứng dụng AI thành công
MediaTek Dimensity 9600M ra mắt: Nâng cấp nhẹ từ Dimensity 9500 với đột phá về thuật toán AI
AI thay đổi cuộc đua săn tìm lỗ hổng an ninh mạng
Huawei bị tố đánh cắp công nghệ robot để chiếm đoạt bí mật thương mại của T-Mobile
Microsoft thừa nhận ứng dụng Word gặp sự cố 'sập' bất thường
Người mẫu - hot girl Mai Trinh vừa đột ngột qua đời không rõ nguyên nhân, hưởng dương 32 tuổi
Tổng thống Ukraine nêu điều kiện chấp nhận ngừng bắn với Nga
Hoài Lâm cầu hôn Ngọc Trinh
Ca sĩ Việt hát 4 bài nhận 1.5 tỷ đồng: Bỏ học Y 1 lần nổi tiếng cả nước, đại diện Việt Nam ra quốc tế
Khởi tố người phụ nữ tổ chức mang thai hộ giá 1,25 tỷ đồng
Sao nữ là thành viên hội bạn Trấn Thành nay bán đồ ăn chay tại phường An Khánh, TP.HCM
Houthi tuyên bố bắn rơi tiêm kích Ả rập Xê út bằng tên lửa tự chế tạo
Ca sĩ Việt vừa trúng cử Ủy viên Trung ương Hội LHTN Việt Nam: Xây biệt phủ báo hiếu, có clip 259 giây nổi tiếng toàn cầu
Mâu thuẫn day dẳng, con dâu dùng dao sát hại mẹ chồng
Cháy nhà 4 tầng ở Hà Nội, 5 người tử vong
Trường Giang thông báo rút khỏi 2 Ngày 1 Đêm
Gặp nhóm thanh niên giải cứu 3 người trong vụ cháy 5 người tử vong ở Hà Nội
Ô tô Mercedes tông liên hoàn 3 xe máy dừng đèn đỏ, kéo lê 10m ở TPHCM
Thứ Năm, thứ Sáu, thứ Bảy 17-19/9: 3 con giáp gặp cơ hội trả sạch nợ cũ, tài lộc khởi sắc
Hoài An 'Người đẹp Tây Đô' tuổi 52 nặng gánh, chưa yêu dù nhiều người theo đuổi
5 phim cổ trang từng bị hoài nghi nhưng càng chiếu càng hot