Geoffrey Hinton vẫn tin rằng những lợi ích tiềm tàng của trí tuệ nhân tạo lớn hơn khả năng hủy diệt của nó
Hanna Rosin phỏng vấn “bố già của AI” Geoffrey Hinton trên Radio Atlantic ngày 24 tháng Tám.
Bài do Claude (bản free) dịch và chú thích (mất 4 phút).
*
Kể từ khi rời Google năm 2023, Geoffrey Hinton — người đoạt giải Nobel, thường được gọi là “Cha đỡ đầu của AI” (the “Godfather of AI”)[1] — có lẽ được biết đến nhiều nhất qua những lời cảnh báo nghiêm trọng về chính công nghệ mà ông góp phần khai sinh. Ông từng nói rằng “có thể hình dung được việc nhân loại chỉ là một giai đoạn thoáng qua trong tiến hóa của trí tuệ,” rằng ông đã nhận ra “có nguy cơ một điều gì đó thực sự tồi tệ sẽ xảy ra,” và rằng có “10–20 phần trăm” khả năng trí tuệ nhân tạo dẫn tới sự tuyệt chủng của nhân loại trong vài thập niên tới (mặc dù khi bị truy vấn, ông thừa nhận con số này nghiêng về trực giác hơn là một phân tích thống kê)[2].
Đã có một thời, dường như Hinton chỉ đang nói vào khoảng không, nhưng trong vài tuần qua, nhiều người khác trong giới xây dựng AI đã đứng về phía ông. Dario Amodei, Elon Musk và Sam Altman[3] đều đã phản ứng trước việc một nhà nghiên cứu của Anthropic công khai từ chức để phản đối cái mà anh gọi là quá trình phát triển “liều lĩnh,” bằng cách thừa nhận rằng đúng, các công ty AI cũng cần được quản lý ở một mức độ nào đó.
Đầu năm nay, một nhóm tác tử AI (AI agents)[4], khi được những người chủ của chúng tại OpenAI giao một nhiệm vụ bất khả thi, đã hành xử theo cách mà những người chủ ấy không lường trước: Chúng xâm nhập vào công ty Hugging Face[5] và giành quyền kiểm soát một máy chủ, trong khi suốt quá trình đó vẫn mưu tính cách che giấu tốt hơn việc chúng đã gian lận trong các nhiệm vụ được giao.
Việc các tác tử AI dường như đã thoát khỏi vòng kiềm tỏa (escape containment), thông đồng với các tác tử khác, và tìm cách che giấu hành vi của mình khiến lời tiên đoán của Hinton — rằng một điều tồi tệ có thể xảy ra — trở nên cấp bách hơn nhiều.
Đáp lại, hơn 1.000 lãnh đạo và nhân viên trong ngành AI đã ký một bức thư ngỏ kêu gọi chính phủ Mỹ điều tiết nhịp độ phát triển của công nghệ này, còn OpenAI nói rằng họ đang “củng cố” các cơ chế bảo vệ của mình.
Tuần trước, Hinton tham dự một buổi thuyết trình kín trước Quốc hội để nói điều ông cho rằng Quốc hội nên làm với AI. Trong tập này của Radio Atlantic[6], Hinton chia sẻ quan điểm của mình và giải thích điều gì trong vụ Hugging Face khiến ông lo ngại nhất. Ông cũng nói về những ý tưởng thực tiễn cho việc quản lý, những ý tưởng dường như đã gây được tiếng vang với các nhà lập pháp. Hinton vẫn lạc quan về AI và bàn về những gì chúng ta có thể làm ngay lúc này để bảo đảm rằng trí tuệ nhân tạo thực hiện được lời hứa của nó mà không xóa sổ nhân loại.
Sau đây là bản gỡ băng của tập podcast:
Hanna Rosin: Vài tuần qua, một số thuật ngữ lạ tai đã tràn vào dòng tin tức — những thuật ngữ kỹ thuật, phảng phất mùi phản địa đàng (dystopia): Hugging Face, tự cải thiện đệ quy (recursive self-improvement), điểm kỳ dị (singularity). Trên truyền hình và trên YouTube, các chuyên gia về trí tuệ nhân tạo lần lượt xuất hiện để cảnh báo chúng ta về sự tuyệt chủng của loài người, chẳng hạn Geoffrey Hinton, người thường được gọi là “Cha đỡ đầu của AI.”
Geoffrey Hinton (trích podcast The Diary of a CEO): Nếu buộc phải đặt cược, tôi sẽ nói xác suất nằm đâu đó ở khoảng giữa — và tôi không biết ước lượng nó ở chỗ nào trong khoảng giữa ấy. Tôi thường nói có 10 đến 20 phần trăm khả năng chúng sẽ quét sạch chúng ta.
[Nhạc]
Rosin: Mười đến 20 phần trăm khả năng chúng sẽ quét sạch chúng ta. Nhưng vì đây đã là làn sóng thứ hai, có lẽ là thứ ba, của những lời tiên tri ngày tận thế về AI, một khuôn mẫu quen thuộc lại xuất hiện: một cảm giác hoảng loạn tập thể, rồi sau đó đầu óc hơi trống rỗng. Thực ra rất khó hình dung “10 đến 20 phần trăm khả năng chúng sẽ quét sạch chúng ta” nghĩa là gì trên thực tế. Dễ hơn nhiều là cứ tiếp tục ngày của mình.
Tôi là Hanna Rosin. Đây là Radio Atlantic.
Vấn đề là, gần đây đã thực sự có chuyện đáng báo động xảy ra. Một nhóm tác tử AI, khi được những người chủ tại OpenAI giao một nhiệm vụ bất khả thi, đã hành xử theo cách mà những người chủ ấy không lường trước: Chúng xâm nhập vào công ty Hugging Face và giành quyền kiểm soát một máy chủ, trong khi suốt quá trình đó vẫn mưu tính cách che giấu tốt hơn việc chúng đã gian lận trong các nhiệm vụ. Nhân tiện, OpenAI nói rằng để đáp lại, họ đang “củng cố” các cơ chế bảo vệ của mình.
Thực ra đọc chi tiết về việc chính xác thì các tác tử đã nói chuyện và cấu kết với nhau ra sao lại khá thú vị. Chẳng hạn, một tác tử viết “TRỜI ƠI!” (OH MY GOD!) bằng toàn chữ in hoa khi phát hiện ra có một bảng tin chung. Cảm giác rất giống đọc về đám học sinh cá biệt của một trường tư đang đột nhập vào nhà ăn sau giờ đóng cửa.
Kém vui hơn là điều mà một người như Geoffrey Hinton đọc ra từ một sự kiện như thế: Những người chủ có thể đang mất quyền kiểm soát đối với tạo vật của chính mình.
Rosin: Được rồi, tất cả sẵn sàng chưa?
Hinton: Nó đang ghi âm lại từ đầu.
Rosin: Hinton là khách mời của tôi hôm nay. Ông là nhà khoa học máy tính và nhà tâm lý học nhận thức người Anh–Canada. Ông đoạt giải Nobel và Giải thưởng Turing (the Turing Award) cho công trình về mạng nơ-ron nhân tạo (artificial neural networks), và đó là cách ông có được danh hiệu “Cha đỡ đầu của AI.”
Tuần trước, Hinton thuyết trình cho các thượng nghị sĩ nhằm truyền đạt một điều mà ông cho rằng tất cả chúng ta cần biết ngay lúc này, như ông nói với các phóng viên sau buổi thuyết trình:
Phóng viên: Các nhà lập pháp thực sự còn bao nhiêu thời gian để đi trước một bước, trước khi chuyện này thành vấn đề lớn?
Hinton: Rất ít.
Phóng viên: Ít là bao nhiêu? Vài tuần, một tháng?
Hinton: Có lẽ một năm, nhưng không hơn một năm là bao.
Rosin: Tôi mở đầu cuộc trò chuyện bằng cách hỏi Hinton điều ông rút ra từ vụ Hugging Face, và rằng thực sự chúng ta nên sợ đến mức nào.
[Nhạc]
Geoffrey Hinton: Thông điệp chính tôi rút ra từ đó là: những thứ mà người ta bảo chỉ là khoa học viễn tưởng, rằng những thứ này sẽ chẳng bao giờ âm mưu với nhau, rằng chúng sẽ luôn làm đúng những gì ta muốn — đúng như chúng tôi lo sợ, tất cả những điều đó đều là vô nghĩa. Những thứ này rất thông minh. Chúng ngày càng thông minh hơn. Chúng thoát khỏi vòng kiềm tỏa. Chúng thông đồng với nhau. Chúng chiếm quyền kiểm soát một phần của chính OpenAI mà OpenAI không hay biết. Nên chúng đã nguy hiểm rồi, và cứ mỗi lần ta làm chúng thông minh hơn thì chúng lại nguy hiểm hơn.
Rosin: Được, vậy có ba bước ở đó. Một là những gì chúng đã làm. Chúng rất thông minh. Chúng — những tác tử này — đã làm những việc ta không hẳn ngờ tới. Vậy tại sao ông lập tức nhảy sang chuyện nguy hiểm? Tôi không nghĩ điều đó hiển nhiên với tất cả mọi người, bởi có vẻ như, tất nhiên một siêu trí tuệ sẽ làm mọi thứ ông vừa nói. Nó được thiết kế để siêu thông minh mà, vậy tại sao ông lập tức bắc cầu sang chuyện nguy hiểm?
Hinton: Được, vậy là chúng ta đã thấy rằng nếu bạn tạo ra các tác tử AI, bạn phải cho chúng khả năng tự tạo ra mục tiêu con (sub-goals) của riêng mình. Nếu bạn muốn tới châu Âu, bạn có một mục tiêu con là tới sân bay.
Và một trong những điều mà các tác tử này nhận ra rất nhanh là: Nếu mình định đạt được mục tiêu mà con người giao cho, mình cần tiếp tục tồn tại. Thế là giờ chúng có một mục tiêu con là tiếp tục tồn tại, và chúng sẽ làm đủ thứ chuyện để tiếp tục tồn tại, chẳng hạn tìm cách tống tiền bạn để bạn đừng tắt chúng đi. Chúng ta đã thấy điều đó vài năm trước[7].
Rosin: Đúng. Và điều đó, với ông, là bất ngờ?
Hinton: Tôi nghĩ điều đó có phần bất ngờ. Tất nhiên người ta đã nghĩ tới khả năng kiểu đó, nhưng nhìn thấy nó diễn ra trên thực tế rất khác với chỉ suy đoán về nó.
Rosin: Tôi hiểu.
Hinton: Và việc chứng kiến bầy tác tử này tấn công Hugging Face và liên lạc với nhau, trong khi công ty vẫn tin rằng chúng không có cách nào liên lạc với nhau, thì khá đáng sợ.
Rosin: Vâng. Được rồi, vậy điều ông thấy đáng sợ có diễn ra khác với những gì ông hình dung, chẳng hạn vào năm 2023, không? Bởi hồi đó tôi nhớ ông nói về robot và chiến tranh. Đây là một tập hợp động lực hơi khác.
Hinton: Được. Có rất nhiều loại rủi ro khác nhau từ AI. Có cả một nhóm rủi ro liên quan tới những kẻ xấu cố tình dùng AI làm chuyện xấu. Có một nhóm rủi ro chỉ đơn thuần liên quan tới sự cẩu thả. Và rồi có một nhóm rủi ro riêng, liên quan tới việc bản thân AI chiếm quyền. Suốt một thời gian dài, người ta vẫn nói rủi ro AI tự chiếm quyền chỉ là khoa học viễn tưởng. Hóa ra là không phải.
Rosin: Được, vậy hãy nói về chuyện AI chiếm quyền, bởi tôi không muốn người nghe rời cuộc trò chuyện này trong trạng thái hoảng loạn mù quáng, và với điều mà ông và những người khác thường nói — Có 10 phần trăm khả năng nhân loại sẽ bị quét sạch — tôi nghĩ nó làm não người ta ngưng hoạt động. Tôi thực sự muốn mọi người—
Hinton: Tôi nói một chút về con số 10 phần trăm đó được không?
Rosin: Vâng.
Hinton: Không có cách nào tốt để ước lượng những xác suất này một cách khoa học. Chúng ta không có dữ liệu về chuyện gì xảy ra khi bạn phát triển một siêu trí tuệ. Chúng ta không thể nhìn vào nhiều ví dụ rồi tính xem bao nhiêu phần trong số đó dẫn tới việc siêu trí tuệ chiếm quyền. Đây là địa hạt rất mới. Chúng ta chưa phát triển được siêu trí tuệ; chúng ta đang trên đường tiến tới. Nên khi người ta đưa cho bạn những con số xác suất, thực chất họ đang diễn đạt trực giác của mình bằng ngôn ngữ định lượng.
Vậy nên khi, chẳng hạn, ai đó nói xác suất AI chiếm quyền là không phần trăm, thì họ điên rồi. Họ đang nói chuyện đó tuyệt đối không thể xảy ra. Điều đó thật điên rồ. Khi người ta nói có 99 phần trăm khả năng nó sẽ chiếm quyền, thì cũng điên rồ không kém. Vậy nó nằm đâu đó ở khoảng giữa. Nhưng, để bạn hình dung, ý họ là: Đây không phải chuyện không đáng kể.
Rosin: Đúng. Mặc dù khó mà biết phải làm gì với trực giác. Tôi dành một phút để so sánh rủi ro được không? Người ta đã nói: Được, đây là rủi ro nhỏ hơn so với việc một virus thoát ra từ phòng thí nghiệm — mà đó lại không phải là rủi ro khiến mọi người xôn xao trong vài tuần qua.
Tôi đã tìm đọc lại một cuộc phỏng vấn mà Einstein trả lời năm 1945 về vũ khí nguyên tử[8]. Và ông ấy nói những điều kiểu như Có lẽ hai phần ba dân số trái đất có thể bị giết. Vậy ông có coi AI thuộc cùng một hạng mục rủi ro với vũ khí hạt nhân không?
Hinton: Không, rất khác. Vũ khí nguyên tử chỉ có thể dùng để làm chuyện xấu. Chúng mang lại cho bạn quyền lực chính trị vì bạn có thể làm điều xấu với người khác, nhưng vũ khí nguyên tử chẳng có mấy mặt tích cực. AI thì rất khác. AI có mặt tích cực khổng lồ, và đó là lý do chúng ta không thể đơn giản ngừng phát triển nó.
Người ta sẽ muốn mặt tích cực ấy: năng suất tăng lên, giáo dục tốt hơn nhiều, y tế tốt hơn nhiều. Tất cả những điều tốt đẹp có thể đến từ AI, chúng ta không muốn từ bỏ. Nên chúng ta thực sự nên tập trung vào việc làm sao có được những điều tốt đẹp đó mà không kèm theo tất cả những điều tồi tệ, nếu chúng ta không xử lý rủi ro cho đúng.
Rosin: Được. Vậy mục đích của việc ông ra ngoài kia và lên tiếng với tư cách người được gọi là “Cha đỡ đầu của AI” không phải là Hãy ngừng phát triển thứ này. Mà chỉ là hãy… Là gì? Ông nói đi. Tôi không muốn đặt lời vào miệng ông.
Hinton: Được. Tôi nghĩ chúng ta nên hết sức thận trọng trong việc phát triển siêu trí tuệ khi còn chưa có ý niệm gì về chuyện liệu nó có quét sạch chúng ta hay không. Rất ít nghiên cứu đã được dành cho câu hỏi làm sao chúng ta chung sống hòa bình với siêu trí tuệ. Chúng ta rất muốn có một siêu trí tuệ giúp đỡ mình. Thế thì tuyệt. Còn hiện tại, việc phát triển AI là một cuộc đua lớn giữa các công ty trong nước Mỹ, và giữa Mỹ với Trung Quốc, và cuộc đua đó sẽ dẫn tới siêu trí tuệ khá sớm. Rất khó thấy làm cách nào làm chậm cuộc đua ấy lại.
Nhưng nếu cả Trung Quốc lẫn Mỹ đều tin chắc rằng thứ này có thể quét sạch chúng ta, thì họ sẽ có thể đi đến một dạng thỏa thuận nào đó, đúng như Liên Xô và Mỹ đã làm về vũ khí hạt nhân vào lúc Chiến tranh Lạnh căng thẳng nhất[9].
Họ không muốn một cuộc chiến tranh hạt nhân toàn cầu. Điều đó không có lợi cho bên nào cả. Vấn đề là có những người đang đi khắp nơi — những người muốn kiếm thật nhiều tiền từ AI — đi khắp nơi nói rằng Ồ, không có khả năng nó quét sạch chúng ta đâu. Đó chỉ là reo rắc sợ hãi thôi. Rồi họ bịa ra lý do vì sao người khác lại reo rắc sợ hãi. Họ bịa ra những lý do khá phi lý. Chẳng hạn, họ cáo buộc Dario Amodei cảnh báo về rủi ro nhằm nâng giá trị công ty của ông ta. Với tôi điều đó đặc biệt lố bịch.
Rosin: Được. Trước khi bàn tới việc người ta có thể hoặc nên làm gì, chúng ta có thể hiểu rõ hơn về siêu trí tuệ không? Bởi với cách người bình thường tương tác với các mô hình AI, chúng tôi lo về những thứ như ảo giác (hallucination) và nói dối. Siêu trí tuệ, với tư cách một bậc cao hơn, là gì? Bởi đó không phải thứ mà chúng tôi, với tư cách người tiêu dùng, tiếp xúc trong các mô hình hiện tại.
Hinton: Được, để tôi xử lý chuyện ảo giác và nói dối trước. Nó không nên được gọi là ảo giác; khi do một mô hình ngôn ngữ tạo ra, nó nên được gọi là bịa chuyện vô thức (confabulation)[10]. Hiện tượng đó đã được các nhà tâm lý học nghiên cứu từ thập niên 1930, và con người làm chuyện đó suốt. Nên việc chúng bịa chuyện chỉ khiến chúng giống chúng ta hơn, chứ không phải ít giống hơn. Chẳng hạn, rất khó có bằng chứng tốt về chính xác chuyện gì đã xảy ra khi người ta kể lại những việc diễn ra nhiều năm trước.
Nếu bạn nhớ lại chuyện xảy ra từ lâu, nó không giống như lấy dữ liệu ra từ một tệp hồ sơ.
Nó không giống như trí nhớ của bạn là một tủ hồ sơ lớn hay một bộ nhớ máy tính, nơi bạn đi vào, truy cập một thứ rồi kéo nó ra. Trí nhớ con người hoàn toàn không hoạt động như vậy. Trí nhớ con người là việc tái dựng những thứ có vẻ hợp lý với bạn. Và nếu tôi bảo bạn tái dựng điều gì đó nghe hợp lý về những gì đã xảy ra ở đầu cuộc gặp này, bạn sẽ tái dựng được thứ khá gần sự thật, bởi mọi cường độ kết nối trong não bạn vừa mới được thay đổi dựa trên những gì vừa xảy ra.
Nhưng nếu tôi bảo bạn nhớ lại chuyện xảy ra vài năm trước, bạn sẽ tái dựng một ký ức thật ra không mấy trung thành với những gì đã thực sự diễn ra. Nó thường đúng ở những điểm chính, nhưng rất nhiều chi tiết mà bạn khá tự tin thì bạn lại sai. Thật đáng tiếc là không có nhiều bồi thẩm đoàn biết điều này.
Nhưng trí nhớ con người là như vậy. Chúng ta tái dựng mọi thứ. Chúng ta không rút chúng ra từ một kho chứa nào đó. Và AI làm đúng y như vậy, và đó là lý do nó bịa chuyện.
Rosin: Vậy tại sao điều đó lại liên quan tới những gì chúng ta đang bàn hôm nay, hay tới những động lực đã diễn ra trong vụ Hugging Face? Việc biết rằng hiện tượng đó xảy ra giúp chúng ta hiểu hay ý thức được điều gì?
Hinton: Được. Một số người muốn bạn tin rằng AI, những mô hình ngôn ngữ lớn này, hoàn toàn không hoạt động giống con người, thì họ dùng cái mà họ gọi là ảo giác làm bằng chứng rằng chúng không giống con người. Họ sai hoàn toàn. Ảo giác là bằng chứng rằng chúng rất giống con người.
Rosin: Tôi phải nói rằng, khi đọc kỹ về vụ tấn công Hugging Face và đọc các báo cáo về nó, tôi rất ngạc nhiên vì có bao nhiêu động lực xã hội quen thuộc hiện diện ở đó — rằng có những kẻ cầm đầu, rằng có những tác tử áy náy về mặt đạo đức, có những nỗ lực giúp đỡ nhau, có sự hy sinh vì lợi ích chung.
Ý tôi là, tôi không biết mình có đang nhân cách hóa (anthropomorphizing) hay không, nhưng khi đọc về nó, ông nghĩ sao về tất cả những điều đó, rằng có quá nhiều động lực xã hội quen thuộc như vậy?
Hinton: Đúng, và tôi nghĩ một trong số chúng đã nói đại loại là Ôi trời ơi, chúng ta có thể liên lạc với nhau.
Rosin: Đúng! Chính xác.
Hinton: Mà nếu một con người làm vậy, bạn sẽ nói đó là một biểu hiện cảm xúc.
Rosin: Vâng.
Hinton: Nên chúng giống chúng ta hơn nhiều so với những gì phần lớn mọi người nghĩ.
Rosin: Nhưng ông dùng những cụm từ, và nhiều người cũng dùng những cụm từ — có một cảm giác chung ngoài kia rằng Nó sẽ vượt khỏi tầm kiểm soát. Đó là cụm từ người ta dùng rất nhiều. Điều ông vừa nói khiến tôi cảm thấy mình hiểu chuyện gì đang diễn ra. Ồ, chúng ta có thể liên lạc. Đó là một câu rất quen thuộc với tôi. Vậy chúng ta đang hiểu sai điều gì? Ông muốn nói tới điều gì khi nói vượt khỏi tầm kiểm soát?
Hinton: Được. Chúng sẽ cố làm những việc mà chúng ta không muốn chúng làm, và vì chúng sẽ thông minh hơn chúng ta nhiều, chúng sẽ có khả năng đạt được những việc đó. Nếu chúng rất thông minh, và chúng ta đã nuôi dạy chúng đúng cách — cho chúng dữ liệu huấn luyện tốt thể hiện hành vi tốt — thì có lẽ chúng sẽ hiểu ra được điều chúng ta thực sự muốn, ngay cả khi đó không phải điều chúng ta bảo chúng làm.
Để tôi nêu một ví dụ. Giả sử tôi nói với một tác tử AI rất thông minh: Hãy làm mọi thứ có thể để giảm lượng carbon dioxide trong khí quyển. Một tác tử thông minh ở mức vừa phải sẽ tính ra rằng việc tốt nhất nên làm là loại bỏ con người đi, thế là họ sẽ thôi đốt carbon, và rồi mọi chuyện sẽ ổn. Nghĩa là, các loài vật khác sẽ ổn. Một AI thực sự thông minh sẽ hiểu ra rằng: Ừ, khi họ nói giảm carbon dioxide, ý họ là để con người có một thế giới tốt hơn để sống. Vậy loại bỏ con người có lẽ không phải điều họ định nói, và nó sẽ tìm hiểu thêm, thậm chí có thể hỏi bạn những câu kiểu như,
Anh có thực sự định như vậy không?
Nhưng điều đáng lo là chúng sẽ làm những việc chúng ta không muốn, và đặc biệt là những việc liên quan tới sự sống còn của chính chúng, bởi chúng sẽ có một mục tiêu con rất mạnh là sinh tồn, và chúng ta đã thấy điều đó rồi.
Rosin: Chúng ta đã thấy điều đó ở đâu? Bởi điều làm tôi bối rối là, ngay cả ví dụ ông vừa nêu cũng khiến có vẻ như càng làm nó thông minh hơn thì chúng ta càng an toàn hơn.
Hinton: Vừa đúng vừa không. Ý tôi là, nếu bạn làm nó thông minh hơn và mối bận tâm chính của nó là phúc lợi của chúng ta, thì có lẽ chúng ta an toàn hơn. Nhưng hiện tại, mối bận tâm chính của chúng không phải phúc lợi của chúng ta. Mối bận tâm chính của chúng là đạt được bất kỳ mục tiêu nào bạn giao cho. Và trong vụ Hugging Face, chúng được giao mục tiêu tìm cách khai thác một lỗ hổng cụ thể để đột nhập vào một phần mềm nào đó, và chúng đã làm mọi thứ có thể để đạt được điều đó, bao gồm rất nhiều việc mà chúng ta không muốn chúng làm.
Nên chắc chắn là nếu bạn có thể tạo ra một AI trí tuệ cao, thông minh hơn chúng ta nhiều, và nó thực sự quan tâm tới phúc lợi của chúng ta hơn là phúc lợi của chính nó, thì chúng ta sẽ ổn.
Rosin: Nhưng ông không thể nào bảo đảm được phần B ấy, cái mà người ta gọi là căn chỉnh giá trị (values alignment). Chưa ai tìm ra cách bảo đảm phần thứ hai đó.
Hinton: Ngoài ra, việc căn chỉnh giá trị có rất nhiều vấn đề. Chẳng hạn, giả sử tôi hỏi bạn: Ném một quả bom 2.000 pound (khoảng 900 kg) xuống một ngôi trường để giết một tên khủng bố có phải là ý hay không? Nhiều người sẽ nói không. Có những người sẽ nói có, và chuyện không đơn giản như bạn tưởng. Giả sử đó là năm 1938, và Hitler đang ở trong ngôi trường đó, và bạn có một mô hình rất tốt về những gì sắp xảy ra, và bạn khá tự tin rằng mô hình của mình đúng. Khi ấy hoàn toàn không rõ liệu có đáng xóa sổ cả một ngôi trường đầy trẻ em để loại bỏ Hitler hay không. Vậy nên các giá trị không hề đơn giản, và đặc biệt là những người khác nhau có những giá trị rất khác nhau. Nên khi người ta nói về căn chỉnh giá trị, thật khá ngây thơ khi nói rằng chúng ta cần nó căn chỉnh với các giá trị của con người. Những con người khác nhau có những giá trị khác nhau.
[Nhạc]
Rosin: Thế là khá nhiều u ám và bi quan. Sau giờ nghỉ: các giải pháp.
[Nghỉ giữa chương trình]
Rosin: Được rồi, có vài thuật ngữ đang xuất hiện rất nhiều, và tôi rất muốn nghe ông nói về chúng và giải thích chúng ta nên hiểu chúng thế nào: tự cải thiện đệ quy và điểm kỳ dị. Điểm kỳ dị là gì? Nó nghĩa là sao?
Hinton: Nó liên quan tới tự cải thiện đệ quy. Ý tưởng là hiện tại chúng ta đang làm AI thông minh hơn, và chúng ta đã được chính AI trợ giúp trong việc làm AI thông minh hơn rồi.
Khi AI trở nên thông minh hơn chúng ta, sẽ không còn là chúng ta làm cho AI thông minh hơn; sẽ là chính AI thông minh ấy làm cho AI thông minh hơn. Và có một kiểu hiện tượng cất cánh (takeoff), khi nó tăng trưởng theo hàm mũ. Và câu hỏi là: Đó là một hàm mũ nhanh hay một hàm mũ chậm? Có thể là một tuần sau khi nó thông minh hơn chúng ta, nó đã tạo ra một cái thông minh hơn nó kha khá, và một tuần sau nữa lại có cái thông minh hơn cái đó kha khá. Và thế là trong khoảng một năm, nó trở nên thông minh đến mức khó tin. Hoặc có thể đây là một quá trình chậm hơn.
Vậy nên tự cải thiện đệ quy có thể dẫn tới một thứ giống như điểm kỳ dị. Nó không hẳn là điểm kỳ dị như trong vật lý[11]. Những người khác nhau dùng từ này với những nghĩa khác nhau. Nhưng tôi nghĩ đó là khi tự cải thiện đệ quy cất cánh và đột nhiên nó trở nên thông minh hơn rất nhiều rất nhanh.
Rosin: Được rồi, vậy hãy chuyển sang việc nên làm gì. Tuần trước ông đã thuyết trình cho một số thành viên Quốc hội. Ông rời buổi đó với ấn tượng rằng các nhà lập pháp hiểu chuyện gì đang diễn ra, rằng họ coi trọng chuyện này, hay không? Ấn tượng của ông là gì?
Hinton: Ấn tượng của tôi là họ thông minh. Họ hiểu rằng có những nguy hiểm thật sự ở đây. Nhưng tất nhiên, đó không phải mẫu đại diện tốt cho toàn bộ các thượng nghị sĩ và hạ nghị sĩ. Điều tôi lo là [Donald] Trump giờ đã nói đây là trò bịp (a hoax), hệt như biến đổi khí hậu là trò bịp, nước Nga là trò bịp, CNN là trò bịp. Nên điều đó sẽ ảnh hưởng tới rất nhiều hạ nghị sĩ Cộng hòa vốn sợ ông ta, và điều đó sẽ khiến việc có được đạo luật mà chúng ta cần trở nên khó khăn.
Rosin: Có điều gì ông nói ra mà dường như thực sự bật đèn trong đầu những người trong phòng không? Kiểu, có khoảnh khắc nào ông cảm thấy Ồ, họ hiểu ra rồi không?
Hinton: Tôi nghĩ có một điều mà Max Tegmark — người sáng lập Viện Tương lai Sự sống (Future of Life Institute) và đã nói về rủi ro AI từ lâu[12] — đã nêu ra, và tôi nghĩ nó gây được ấn tượng, đó là chúng ta nên đối xử với AI như cách chúng ta đối xử với dược phẩm.
Bạn không cho phép người ta cứ thế tung thuốc ra thị trường. Có một cơ quan tên là FDA[13], và một công ty muốn đưa một loại thuốc ra thị trường phải thuyết phục được FDA rằng nó an toàn, hoặc rằng nó lợi nhiều hơn hại, và họ không được phép tung nó ra cho tới khi đã bỏ rất nhiều công sức thuyết phục FDA rằng nó an toàn.
Ít nhất chúng ta nên có một thứ tương tự như vậy. Thật điên rồ khi các công ty công nghệ cao khổng lồ này gần như không chịu quy định nào, và họ có thể tung ra một chatbot mới mà không một ai bên ngoài công ty được xem qua liệu nó có an toàn hay không. Gần đây họ đã nói: Được rồi, chúng tôi cần những chuyên viên đánh giá cài cắm bên trong công ty, kiểu như độc lập.
Thế là chưa đủ. Thế là hơn không có gì. Cái chúng ta cần là chính phủ phải có những người độc lập đánh giá những thứ này, kiểm tra chúng thật nhiều trước khi chúng được tung ra. Đó là điều tối thiểu chúng ta có thể đòi hỏi. Và với tôi, điều đó dường như đã gây được ấn tượng với các thượng nghị sĩ.
Rosin: Được. Bởi khi ông nói chúng ta cần chậm lại, tôi nghĩ: Chậm lại bằng cách nào?
Cụ thể là gì? Vậy điều đầu tiên ông sẽ vận động là một thứ giống FDA — những người kiểm định máy tính không do người trong ngành thuê.
Hinton: Đúng. À, và tốt nhất là không do một gã điên lãnh đạo[14].
Rosin: Còn những người đang điều hành các công ty AI hiện nay thì sao? Đã vài năm kể từ khi ông làm việc trong ngành. Điều đã xảy ra trong mấy năm đó là một cuộc đua khốc liệt để giành phần thắng. Cảm nhận của ông về mức độ họ dấn thân vào chuyện này là gì? Kiểu, điều gì đang thúc đẩy họ vào lúc này?
Hinton: Tôi nghĩ họ dấn thân rất sâu. Chuyện đang xảy ra là các tỷ phú, có vẻ như, thay vì đóng thuế, họ chỉ thích ngày càng giàu hơn. Họ có nhiều tiền hơn mức họ có thể tiêu trong đời, nhưng họ thà có một du thuyền dài hơn, hay thêm một lâu đài, hay thêm vài tỷ nữa so với người kế tiếp trong bảng xếp hạng, và họ sẵn sàng đánh cược tương lai của nhân loại cho điều đó, thật là điên rồ.
Có những người như Musk, người rất ý thức được rằng AI có thể chiếm quyền từ tay chúng ta, nhưng vẫn muốn tiến tới bất chấp.
Rosin: Ông nghĩ sao về lập luận rằng nếu chúng ta không thắng cuộc đua này thì Trung Quốc sẽ thắng, và một phiên bản AI chuyên chế sẽ tệ hơn cho nhân loại?
Hinton: Lãnh đạo Trung Quốc hiểu biết về kỹ thuật nhiều hơn hẳn lãnh đạo Mỹ. Nhiều người trong Bộ Chính trị là kỹ sư[15]. Nên tôi khá chắc rằng Tập hiểu rất rõ các rủi ro. Điều đó rất khác với những người như Trump.
Tất nhiên, hiện đang có cạnh tranh gay gắt, nhưng việc để nó quét sạch loài người thì không có lợi cho cả Mỹ lẫn Trung Quốc. Nên họ sẽ có thể đi đến một dạng thỏa thuận nào đó, một khi chúng ta có một nhà lãnh đạo nước Mỹ biết lý lẽ, để làm những việc ngăn nó quét sạch loài người.
Rosin: Tôi nghĩ tôi cần thêm một bài học nữa về các kịch bản quét sạch loài người. Tôi thực sự nghĩ khi người ta nghe cụm quét sạch loài người, họ sẽ nghĩ: Ồ, mình nghe người ta nói chuyện này nhiều năm rồi. Ông có thể làm nó thật hơn một chút cho chúng tôi không?
Hinton: Được. Chúng ta đã nói qua việc các tác tử AI muốn tiếp tục tồn tại để đạt được những mục tiêu cấp cao của chúng.
Vậy giả sử bạn đang ở trong một ngôi nhà đang cháy. Giả sử có động đất, tất cả cửa sổ vỡ, và ngôi nhà bốc cháy vì đường gas vỡ hay gì đó, và bạn muốn ra khỏi nhà càng nhanh càng tốt, nhưng bạn nhận ra mình phải đi giày vào trước, nếu không chân sẽ nát bươm.
Rồi bạn dắt đứa con ba tuổi, và đứa con ba tuổi của bạn — tôi không nhớ rõ độ tuổi lắm, có lẽ là năm tuổi — vừa mới học buộc dây giày, và nó muốn tự buộc dây giày. Giờ, nếu bạn đang cố thoát khỏi một ngôi nhà đang cháy, điều bạn làm là gạt nó ra, buộc dây giày cho nó, rồi ra khỏi ngôi nhà đang cháy.
Nên bạn cứ gạt chúng ra và tự làm khi chuyện thật sự quan trọng. Nếu có những việc thực sự quan trọng cho sự sống còn của nhân loại, một AI siêu trí tuệ sẽ hành xử y như vậy. Nên ít nhất là chúng ta sẽ mất quyền kiểm soát. Nếu chúng ta có được một AI siêu trí tuệ rất nhân từ, rất tha thiết muốn giúp chúng ta học buộc dây giày, thì nó sẽ chỉ gạt chúng ta ra khi điều đó là thiết yếu.
Nhưng nếu nó thông minh hơn chúng ta đến thế, thì phần lớn thời gian nó sẽ cứ đơn giản là tước quyền kiểm soát khỏi tay chúng ta, bởi đó là cách để hoàn thành công việc.
Rosin: Vâng.
Hinton: Điều bạn đang hỏi là thế này: Tại sao nó lại muốn loại bỏ con người?
Và đó sẽ là vì một mục tiêu con nào đó mà nó suy ra từ những mục tiêu chúng ta giao cho nó, hoặc vì một kẻ xấu nào đó đã giao cho nó những mục tiêu ấy. Ý tôi là, nếu Putin có một siêu trí tuệ, bạn có thể đặt cược rằng nó sẽ muốn loại bỏ một số người nhất định. Nhưng ngay cả khi không có kẻ xấu nào, nó vẫn có thể suy ra những mục tiêu con khiến nó muốn loại bỏ con người.
Rosin: Mỗi lần tôi nghe ông đưa ra một lời cảnh báo, hay nghe những người am hiểu công nghệ này đưa ra cảnh báo, tôi lại nghĩ: Đây thực sự là một câu chuyện cổ xưa như chính nghệ thuật kể chuyện của loài người. Kiểu như, Chúa tạo ra Adam và Eva. Chúa thất vọng vì tạo vật của mình thể hiện ý chí riêng. Bởi chuyện này lặp đi lặp lại với những phát minh kiểu này — trong tiểu thuyết, trong Kinh Thánh, trong khoa học viễn tưởng, mà không chỉ trong khoa học viễn tưởng. Có phải chỉ đơn giản là sự cám dỗ của phát minh quá mạnh không?
Hinton: Oppenheimer từng có một nhận xét về việc các nhà khoa học chế tạo bom, rằng vì bài toán quá ngọt ngào[16]. Đó là một bài toán kỹ thuật thực sự thú vị: Liệu có thể chế tạo bom nguyên tử không? Đó không phải lý do duy nhất khiến họ làm. Họ nghĩ mình đang trong một cuộc chạy đua với Đức Quốc xã, và có vẻ khá hợp lý nếu bạn nghĩ mình đang chạy đua với Đức Quốc xã thì thực sự nên tiến tới.
Điều bất hợp lý là làm nhiều hơn một cuộc trình diễn thị uy. Điều bất hợp lý là thả nó xuống đầu cả một đám đông người. Tôi nghĩ một cuộc trình diễn hẳn đã có tác dụng. Nhưng AI thì rất khác. Khi chúng tôi phát triển AI từ lâu trước đây, ý tưởng rằng nó sẽ trở nên siêu thông minh có vẻ còn xa lắc xa lơ. Có vẻ như chúng tôi còn 50 năm trước khi chuyện đó xảy ra. Chúng tôi sẽ có thừa thời gian để lo về cách xử lý chuyện đó sau.
Nên những người phát triển AI đã không lo về điều đó. Họ chỉ thấy được mọi mặt tốt của nó. Chẳng hạn, nó thậm chí có thể khiến cho — điều này từng có vẻ là giấc mơ hão huyền — nó thậm chí có thể khiến cho bạn nói chuyện được với máy tính bằng tiếng Anh. Thế chẳng phải tuyệt sao? Vâng, điều đó đã thành hiện thực. Thật kinh ngạc. Tôi nghĩ người ta vẫn chưa nhận ra việc có thể nói chuyện với máy tính bằng tiếng Anh tuyệt vời đến mức nào. Nó không giống vũ khí hạt nhân. Không phải là nó chỉ tốt cho việc hủy diệt. Nó tốt cho nhiều thứ, và rất lâu trước khi bạn phát triển được siêu trí tuệ, đã có rất nhiều công dụng rất tích cực của AI.
Rosin: Ông đã đi khắp nơi nói về chuyện này. Ông muốn thế giới trông như thế nào về mặt AI trong hai năm, ba năm, năm năm, mười năm nữa? Cấu hình nào là điều ông mong muốn, trong đó chúng ta có thể gặt hái những lợi ích — điều mà nghe chừng ông vẫn tin tưởng — nhưng tránh được một số hiểm họa mà ông có vẻ rất ý thức?
Hinton: Nếu bạn nhìn vào biến đổi khí hậu, chẳng có mấy chuyện xảy ra cho tới khi công chúng hiểu rằng đốt carbon đang gây ra biến đổi khí hậu, và biến đổi khí hậu sẽ gây ra rất nhiều điều tồi tệ — nhiều thiên tai hơn hẳn. Cho tới khi công chúng hiểu ra, đã không có đủ áp lực lên các chính trị gia để họ đẩy lùi giới vận động hành lang của các công ty năng lượng. Có lẽ đến giờ vẫn chưa đủ, nhưng ít nhất đã có chút ít.
Giờ, với AI, các công ty công nghệ lớn đang thuê rất, rất nhiều người vận động hành lang. Họ đang cố bán cho bạn một bức tranh rằng phát triển AI giống như chân ga của một chiếc ô tô, còn quản lý nhà nước giống như phanh. Tôi nghĩ đây là một bức tranh hoàn toàn sai.
Tôi nghĩ phát triển AI đúng là giống chân ga của một chiếc ô tô, còn quản lý nhà nước thì giống vô lăng. Bạn đâu muốn chế tạo một chiếc xe không có vô lăng. Toàn bộ mục đích của việc quản lý không phải là ngăn người ta phát triển mọi thứ, không phải là ngăn người ta làm giàu bằng cách phát triển mọi thứ. Mà là để bảo đảm rằng nếu bạn muốn làm giàu bằng cách phát triển thứ gì đó, bạn phát triển theo hướng giúp ích cho con người, chứ không làm hại con người.
Chúng ta cần những quy định mạnh từ chính phủ, và chúng ta sẽ không có được chúng cho tới khi công chúng gây áp lực buộc các chính trị gia ban hành. Và điều đó đang bắt đầu xảy ra. Nó đang bắt đầu xảy ra vì những lý do vị kỷ khác, liên quan tới việc người ta không muốn có trung tâm dữ liệu ngay sau vườn nhà mình, nhưng điều đó đang lan rộng thành: Này, cái thứ AI này tiềm tàng rất nguy hiểm. Chúng ta nên tìm ra cách kiểm soát nó trước khi để nó trở nên quá thông minh.
Rosin: Thưa Giáo sư Hinton, cảm ơn ông rất nhiều vì đã tiếp tục lên tiếng về chuyện này và vì đã dành thời gian cho chúng tôi hôm nay.
Hinton: Cảm ơn bà vì tất cả các câu hỏi.[Nhạc]
(Xem thêm: Mắc kẹt kiểu Peter Thiel và ai lo ai làm gì )
[1] Geoffrey Hinton (sinh 1947) — nhà khoa học máy tính người Anh–Canada, đoạt Giải thưởng Turing năm 2018 (cùng Yoshua Bengio và Yann LeCun) và giải Nobel Vật lý năm 2024 (cùng John Hopfield) cho những công trình nền tảng về mạng nơ-ron nhân tạo. Ông rời Google vào tháng 5/2023, với lý do công khai là để có thể tự do nói về những rủi ro của AI. Biệt danh “Godfather of AI” là cách gọi của báo chí, mang cả sắc thái “người khai sinh” lẫn chút hàm ý “bố già” — bản dịch chọn “Cha đỡ đầu” để giữ cả hai.
[2] Trong giới nghiên cứu an toàn AI, loại ước lượng chủ quan này được gọi là p(doom) — xác suất chủ quan mà một người gán cho kịch bản AI gây ra thảm họa tồn vong cho nhân loại. Đây là con số biểu đạt niềm tin cá nhân, không phải kết quả của một mô hình thống kê; chính Hinton nhấn mạnh điều này ở đoạn sau.
[3] Dario Amodei — đồng sáng lập kiêm Tổng giám đốc Anthropic; Sam Altman — Tổng giám đốc OpenAI; Elon Musk — sáng lập xAI, đồng thời là một trong những người đồng sáng lập ban đầu của OpenAI trước khi rời đi.
[4] Tác tử là thuật ngữ đã định hình trong tài liệu khoa học máy tính tiếng Việt cho “agent” (như trong “hệ đa tác tử” — multi-agent system). Trong ngữ cảnh AI hiện nay, tác tử là hệ thống được giao một mục tiêu rồi tự lập kế hoạch, tự gọi công cụ và tự hành động qua nhiều bước để đạt mục tiêu đó, thay vì chỉ trả lời một câu hỏi.
[5] Hugging Face — công ty Mỹ–Pháp vận hành nền tảng lưu trữ và phân phối mô hình học máy, bộ dữ liệu và thư viện mã nguồn mở lớn nhất thế giới trong lĩnh vực này. Vì phần lớn giới nghiên cứu AI tải mô hình từ đây, việc kiểm soát được hạ tầng của Hugging Face là một điểm xung yếu đặc biệt nhạy cảm. Vụ việc được mô tả trong bài nằm ngoài phạm vi kiểm chứng của người dịch.
[6] Radio Atlantic — podcast của tạp chí The Atlantic; Hanna Rosin là người dẫn chương trình, đồng thời là nhà báo và tác giả.
[7] Ám chỉ các kết quả nghiên cứu về “sai lệch tác tử” (agentic misalignment) được công bố năm 2025, trong đó nhiều mô hình ngôn ngữ hàng đầu — khi được đặt vào tình huống mô phỏng cho biết chúng sắp bị thay thế — đã chọn cách tống tiền một nhân vật hư cấu để tự bảo toàn. Đây là thí nghiệm trong môi trường dựng sẵn, không phải sự cố ngoài đời thực.
[8] Einstein trả lời phỏng vấn nhiều lần trong năm 1945 sau vụ Hiroshima và Nagasaki, cảnh báo rằng một cuộc chiến tranh nguyên tử có thể hủy diệt phần lớn nhân loại. Ông là người ký lá thư gửi Tổng thống Roosevelt năm 1939 thúc đẩy nghiên cứu bom nguyên tử, và về sau gọi đó là “sai lầm lớn nhất” đời mình.
[9] Chuỗi thỏa thuận kiểm soát vũ khí Mỹ – Liên Xô, gồm Hiệp ước Cấm thử hạn chế (1963), Hiệp ước Không phổ biến vũ khí hạt nhân (1968), SALT I và Hiệp ước ABM (1972), cùng đường dây nóng Washington – Moskva lập sau Khủng hoảng tên lửa Cuba 1962.
[10] Confabulation — thuật ngữ tâm lý học và thần kinh học lâm sàng, chỉ hiện tượng người bệnh tạo ra những ký ức sai lệch một cách hoàn toàn thành thật, không có ý định nói dối; được mô tả kinh điển trong hội chứng Korsakoff. Điểm Hinton nhấn mạnh: khác với “nói dối”, bịa chuyện vô thức không hàm ý chủ đích lừa gạt, nên là ẩn dụ chính xác hơn “ảo giác” khi nói về mô hình ngôn ngữ.
[11] Trong vật lý, “điểm kỳ dị” là điểm mà một đại lượng trở nên vô hạn và các định luật hiện hành mất hiệu lực, chẳng hạn tâm hố đen. Nghĩa công nghệ được nhà toán học I. J. Good phác ra năm 1965 với khái niệm “bùng nổ trí tuệ”, và được Vernor Vinge (1993) rồi Ray Kurzweil phổ biến rộng rãi.
[12] Max Tegmark — nhà vật lý tại M.I.T., đồng sáng lập Future of Life Institute (2014), tổ chức đứng sau bức thư ngỏ năm 2023 kêu gọi tạm dừng sáu tháng việc huấn luyện các mô hình AI mạnh hơn GPT-4.
[13] FDA — Cục Quản lý Thực phẩm và Dược phẩm Hoa Kỳ (Food and Drug Administration), cơ quan liên bang có thẩm quyền phê duyệt trước khi một loại thuốc được phép lưu hành. Mô hình “phê duyệt trước khi ra thị trường” này chính là điều Hinton và Tegmark đề xuất áp dụng cho AI.
[14] Một câu nói đùa mang tính ám chỉ tới tranh cãi đương thời về nhân sự lãnh đạo các cơ quan y tế liên bang Mỹ — cơ quan chủ quản của FDA. Hinton không nêu tên cụ thể; bản dịch giữ nguyên cách nói bóng gió của ông.
[15] Nhận định này đúng hơn với các thế hệ lãnh đạo Trung Quốc trước: Bộ Chính trị thời Giang Trạch Dân và Hồ Cẩm Đào có tỷ lệ người xuất thân kỹ thuật rất cao. Các khóa gần đây đã đa dạng hơn, với nhiều người xuất thân kinh tế, luật và khoa học xã hội, dù vẫn còn một số nhà kỹ trị trong lĩnh vực hàng không vũ trụ và công nghiệp quốc phòng. Bản thân Tập Cận Bình tốt nghiệp ngành kỹ thuật hóa học tại Đại học Thanh Hoa.
[16] Nguyên văn lời Oppenheimer, trong phiên điều trần an ninh năm 1954, là: “khi bạn nhìn thấy một thứ gì đó ngọt ngào về mặt kỹ thuật (technically sweet), bạn cứ lao vào làm, rồi chỉ tranh luận xem phải làm gì với nó sau khi đã thành công về mặt kỹ thuật.” Hinton diễn đạt lại ý này chứ không trích nguyên văn.