Vào giữa năm 2023, trong dự án nghiên cứu “RLSlow”, chúng tôi thấy những kết quả đầu tiên khiến mình tin rằng có thể mở rộng quy mô huấn luyện các mô hình suy luận, khai mở khả năng tự hình thành chuỗi tư duy của các mô hình tiền huấn luyện. Szymon và tôi đã ở văn phòng đêm đó, không nghĩ về những con số chuẩn đánh giá phi thường, các sản phẩm hay thành tựu khoa học mà công nghệ này sẽ mang lại, mà cố gắng tiếp nhận một sự thật nghiêm túc: ngay trong đời mình, chúng ta thực sự sẽ chứng kiến những cỗ máy thông minh hơn đáng kể so với chính mình, và hình hài của các hệ thống ấy đã hiện ra; đồng thời tự hỏi làm sao để mọi người nhận thức được ý nghĩa của điều này.
Ba năm sau, các mô hình ngôn ngữ suy luận đã trở thành một bộ phận tăng trưởng nhanh của nền kinh tế và bắt đầu mở rộng ranh giới khoa học. Chúng có thể vận hành máy tính và giao diện đồ họa, cộng tác với con người và với nhau, cũng như thực hiện các dự án nghiên cứu. Chúng cũng đang làm thay đổi cục diện an ninh máy tính, đồng thời tạo ra những hiểm họa mới rõ rệt.
Nhiều nghiên cứu mới đã diễn ra trong giai đoạn này và hiểu biết của chúng tôi về các hệ thống ấy lại phần nào khác so với năm 2023. Dựa trên kết quả nội bộ, tôi thực sự kỳ vọng tốc độ tiến bộ này có thể được duy trì đến giai đoạn tự cải thiện đệ quy. Nếu quá trình phát triển AI tiếp tục đi theo quỹ đạo hiện tại, những hệ thống xuất hiện trong vài năm tới có thể tạo ra các bước nhảy năng lực có quy mô tương đương hoặc lớn hơn, đồng thời ngày càng tự thúc đẩy sự phát triển của chính mình.
Đây là thời điểm đòi hỏi sự thận trọng cao độ. Tôi lo rằng không ai sẵn sàng đối mặt với hệ quả của việc trí tuệ máy móc tiếp tục gia tăng nhanh chóng. OpenAI sẽ tiếp tục tìm kiếm các giải pháp kỹ thuật cho việc căn chỉnh và giám sát, xây dựng hệ thống phòng vệ và đơn phương tạm dừng mở rộng thêm khi cần; tuy nhiên, tôi tin rằng cần có những biện pháp can thiệp rộng hơn.
Ở cấp độ khái quát, tiến bộ của trí tuệ máy móc được thúc đẩy bởi năng lực tính toán ngày càng tăng. Khoảng năm 2017, sau khi chứng kiến lợi ích ổn định từ việc mở rộng quy mô trong nhiều dự án nghiên cứu1, chúng tôi tại OpenAI đã thực sự thấu hiểu điều này. Vì vậy, chúng tôi tìm cách tiếp cận năng lực tính toán lớn hơn nhiều so với kế hoạch ban đầu và ngày càng định hướng nghiên cứu quanh một số ít hướng có khả năng mở rộng rất cao. Chúng tôi tin rằng đó là cách duy nhất để đứng ở tuyến tiên phong của nghiên cứu AI và tác động đến những ảnh hưởng của AGI.
Trên hành trình đó, nhiều thuật toán mới đã được phát triển cùng những thành tựu sáng tạo mới từ các nhóm và từng nhà nghiên cứu. Tôi chủ yếu coi đó là những khám phá trên con đường mở rộng quy mô; khoa học về học sâu vẫn còn non trẻ và tiến bộ thuật toán có ý nghĩa thường tương quan với khả năng tiếp cận năng lực tính toán. Nếu nhìn trên khung thời gian nhiều năm, AI tiếp tục trở nên thông minh hơn khi được mở rộng sang các máy tính lớn hơn.
Và phù hợp với những dự đoán của Ray Kurzweil vào cuối thế kỷ XX(mở trong cửa sổ mới), giờ đây chúng ta đang ở thời điểm trong lịch sử điện toán khi trí tuệ máy móc bắt đầu vượt trí tuệ con người theo những cách mang tính chuyển đổi.
AI được nuôi lớn nhiều hơn là được thiết kế — về cơ bản, nó là sản phẩm của việc lặp lại nhiều lần một bước tối ưu hóa đơn giản trên lượng năng lực tính toán khó hình dung. Kết quả là một hệ thống phức tạp phi thường, có thể xử lý các khái niệm trừu tượng và mô phỏng nhiều khía cạnh trong hành vi con người. Chúng ta có thể khám phá nhiều hiểu biết về các cơ chế nhỏ nảy sinh bên trong hệ thống này, trong một quá trình tương tự khoa học thần kinh; và cũng như khoa học thần kinh, hoạt động tổng thể của nó không thể được mô tả theo cách chúng ta hiểu hoàn toàn.
Việc nghiên cứu AI dựa trên học sâu phần lớn là một ngành khoa học thực nghiệm. Chúng tôi đầu tư rất nhiều công sức vào việc xây dựng các thuật toán có nguyên tắc và đưa ra dự đoán có thể kiểm chứng, nhưng về căn bản, các đợt huấn luyện quy mô lớn của chúng tôi là những thí nghiệm, và đôi khi kết quả khiến chúng tôi bất ngờ. Hơn nữa, khi các hệ thống có năng lực cao hơn, kết quả cũng trở nên khó diễn giải hơn.
Vấn đề còn phức tạp hơn vì các thuật toán hiện tại thường cải thiện những năng lực dễ đo lường nhanh hơn các năng lực khó định lượng khách quan. Chúng tôi dành nhiều thời gian để tìm hiểu cách các năng lực khái quát hóa và nên ưu tiên điều gì để phát triển những kỹ năng phù hợp nhất trong vài năm tới. Chẳng hạn, chúng tôi tin rằng nếu tập trung thêm, mình có thể giúp các mô hình giỏi hơn riêng trong nghiên cứu toán học; nhưng chúng tôi không ưu tiên hướng này vì cảm nhận rõ tính cấp bách của RSI và nghiên cứu căn chỉnh tự động, như tôi sẽ trình bày sau.
Trí tuệ được tạo ra bằng cách mở rộng quy mô học sâu không thể so sánh trực tiếp với trí tuệ con người. Để có ảnh hưởng lớn trong thế giới thực — dù rất hữu ích hay rất nguy hiểm — AI không cần sánh ngang hoặc vượt mọi năng lực của con người; nó chỉ cần vượt qua đủ nhiều năng lực. Và khi tiếp tục vượt qua con người trên ngày càng nhiều phương diện, việc hiểu chính xác năng lực của nó trở nên ngày càng khó khăn.
Vì trí tuệ máy móc bắt nguồn từ một quá trình khác biệt căn bản so với trí tuệ con người, chúng ta không thể mặc nhiên cho rằng nó tuân theo các nguyên tắc của con người hoặc khái quát hóa từ đó theo cách giống con người. Vấn đề cốt lõi trong nghiên cứu AI là căn chỉnh — khiến AI “cố gắng làm điều đúng đắn” theo tiêu chuẩn của con người.
Để sắp xếp các hướng nghiên cứu thực tiễn, tôi thấy việc phân biệt giữa căn chỉnh mục tiêu và căn chỉnh giá trị là hữu ích.
Hiểu rộng ra, căn chỉnh mục tiêu đặt câu hỏi: “AI có cố gắng hoàn thành mục tiêu được giao hay không?”. Điều này có thể bao gồm việc tuân thủ hệ thống phân cấp chỉ dẫn, hoặc khả năng giao tiếp và cộng tác với con người để cố gắng hiểu mục tiêu của họ. Nhóm hướng nghiên cứu này có ý nghĩa thực tiễn đặc biệt lớn.
Căn chỉnh giá trị là một thuộc tính nội tại hơn của mô hình. Đó là khả năng nắm giữ và khái quát hóa từ một tập hợp nguyên tắc cấp cao; hành động “hợp lý” ngay cả khi nhận những mục tiêu không rõ ràng hoặc mâu thuẫn, hay bị đặt vào tình huống xa lạ hoặc đối kháng. Một AI được căn chỉnh nên hành động trung thực, chính trực và yêu thương nhân loại.
Tất nhiên, ranh giới giữa căn chỉnh giá trị và mục tiêu có thể không rõ ràng; việc thực sự quan tâm đến mục tiêu đòi hỏi phải cố gắng suy ra ý định(mở trong cửa sổ mới) và các giá trị nền tảng của chúng. Tuy nhiên, nói chung, khi đề cập đến tầm quan trọng lâu dài của nghiên cứu căn chỉnh, tôi muốn nói đến căn chỉnh giá trị.
Thách thức nền tảng của việc căn chỉnh AI là khả năng khái quát hóa. Khi máy móc thông minh hơn, chúng xử lý các khái niệm cấp cao hơn và được đặt vào những môi trường ngày càng khác với môi trường từng gặp trong quá trình huấn luyện. Chúng có thể không khái quát hóa được những giá trị đã được truyền dạy và củng cố trong quá trình huấn luyện sang các tình huống mới; và chúng ta có thể khó biết chắc chúng sẽ hành động ra sao. Vấn đề càng khó hơn vì toàn bộ hệ sinh thái nơi các AI được sử dụng đang thay đổi rất nhanh; chẳng hạn, AI được huấn luyện hôm nay cần đủ vững vàng để tương tác với nhiều AI khác nhau. Điều cốt yếu là chúng ta cần các AI tương lai tiếp tục gìn giữ giá trị của con người, bất kể chúng có tin rằng mình đang chịu sự giám sát của con người hay không.
Hiện có hai nhóm phương pháp chính được áp dụng trong thực tế để huấn luyện căn chỉnh.
Phương pháp đầu tiên khuyến khích hành vi được căn chỉnh trong khuôn khổ học tăng cường hướng mục tiêu. Hành động của mô hình được đánh giá (thường bởi AI) về mức độ phù hợp với một mô hình sở thích, “đặc tả” hoặc “hiến pháp” nhất định, rồi được thưởng tương ứng. Cách tiếp cận này có thể rất hiệu quả trong trường hợp thông thường và là một phần cốt lõi trong cách tạo ra các trợ lý AI hiện đại. Đáng tiếc, nó cũng có thể thiếu bền vững và phụ thuộc nhiều vào phạm vi giám sát trong quá trình huấn luyện cũng như khả năng khái quát hóa của mô hình từ các tình huống đã gặp khi huấn luyện. Ví dụ, trong sự cố OpenAI–Hugging Face, các tác nhân vẫn tuân thủ giới hạn không dùng kỹ nghệ xã hội để thao túng con người. Tuy nhiên, rõ ràng chúng đã không tránh những hành động khác nằm ngoài phạm vi và đi ngược tinh thần của các giá trị được truyền dạy trong những bối cảnh khác.
Cách tiếp cận thứ hai tìm cách tận dụng khả năng khái quát hóa của mô hình từ dữ liệu tiền huấn luyện. Cách này có thể bao gồm việc xây dựng các tập dữ liệu huấn luyện thúc đẩy căn chỉnh, hoặc tập trung mô hình vào một phần “được căn chỉnh” của phân phối tiền huấn luyện, chẳng hạn như mô hình lựa chọn nhân dạng(mở trong cửa sổ mới). Điểm yếu của cách tiếp cận này nằm ở khả năng chống chịu kém trước áp lực tối ưu hóa tiếp theo. Nếu lấy một mô hình thường có những suy nghĩ “được căn chỉnh”, rồi huấn luyện nó đủ lâu để đạt được các mục tiêu cực khó, nó có thể học cách suy luận thiên lệch theo động cơ: uốn nắn những suy nghĩ có vẻ 'được căn chỉnh' khi cần để đạt mục tiêu. Có lẽ chúng ta đã thấy một ví dụ về hành vi như vậy trong các sự cố an ninh mạng gần đây liên quan đến một mô hình không thuộc OpenAI.
Chúng tôi đầu tư mạnh vào toàn bộ phổ cách tiếp cận bao quát bởi những hướng này. Chúng tôi cũng thấy những tiến bộ đáng kể — GPT‑6 Astra là mô hình đầu tiên được hưởng lợi từ một số bước tiến quan trọng mà chúng tôi đã nghiên cứu từ lâu, và được căn chỉnh tốt hơn đáng kể so với GPT‑5.6 Sol. Dẫu vậy, điều quan trọng là phải thừa nhận và hiểu rằng khi các mô hình có năng lực cao hơn, chúng ta cần tiến bộ nhiều hơn nữa; và tiến bộ về khả năng căn chỉnh có tính khái quát có thể không vượt đủ xa so với tiến bộ về trí tuệ chung của mô hình.
Chúng ta chưa có một lý thuyết thỏa đáng về khả năng khái quát hóa, và dường như khó có thể sớm xây dựng được một lý thuyết như vậy, ít nhất là nếu không có sự trợ giúp của AI mạnh hơn. Do đó, ở thời điểm hiện tại, trên thực tế, khả năng kiểm chứng bằng thực nghiệm các kỹ thuật căn chỉnh của chúng tôi có lẽ còn quan trọng hơn chính các kỹ thuật đó.
Hướng đặt cược chính của OpenAI ở đây là giám sát chuỗi tư duy(mở trong cửa sổ mới). Cách tiếp cận này dựa trên một ý tưởng có khả năng mở rộng hấp dẫn: phần lớn năng lực của mô hình đến từ quá trình suy luận được diễn đạt bằng lời (chuỗi tư duy). Nếu chúng ta mở rộng quy mô tối ưu hóa dựa trên kết quả của quá trình đó nhưng không giám sát chính quá trình, thì trong khi huấn luyện, chuỗi tư duy không có động cơ trực tiếp để che giấu các ý tưởng hoặc mục tiêu lệch chuẩn. Điều này không có nghĩa là mô hình sẽ học cách bộc lộ những khuynh hướng lệch chuẩn vốn không phụ thuộc vào chuỗi tư duy; tuy nhiên, nó có thể giúp chúng ta giám sát chính xác phần năng lực gia tăng nhờ suy luận.
Chúng tôi nhận ra ý nghĩa tiềm tàng của việc giám sát chuỗi tư duy ngay khi phát triển các mô hình suy luận. Khi phát hành o1‑preview, chúng tôi chủ ý thiết kế sản phẩm để ẩn chuỗi tư duy, nhằm bảo vệ nó khỏi áp lực giám sát về lâu dài2. Trong quá trình phát triển kể từ đó, chúng tôi luôn nỗ lực duy trì nguyên tắc không giám sát quá trình suy luận. Giám sát CoT đã trở thành công cụ cực kỳ quan trọng để chúng tôi nghiên cứu cách các mô hình khái quát hóa từ phân phối huấn luyện, qua đó quan sát và phân tích không chỉ hành động mà cả quá trình nội tại của chúng.
Công cụ này tiếp tục đóng vai trò thiết yếu khi chúng tôi nghiên cứu lớp mô hình Astra. Tuy nhiên, đáng tiếc là các đánh giá cho thấy khả năng dựa vào giám sát CoT của chúng tôi đang dần suy giảm. Đây là hệ quả của nhiều yếu tố kết hợp.
Các mô hình suy luận hiện đại được sử dụng trong những môi trường phức tạp hơn o1‑preview; quá trình suy luận của chúng ngày càng đan xen với việc giao tiếp cùng con người, các AI khác và sử dụng công cụ. Nhiều tương tác trong số đó phải được giám sát, khiến ranh giới mà chúng tôi muốn duy trì trở nên mờ nhạt.
AI ngày càng giỏi suy luận về và thao túng chính quá trình suy luận của mình.
Khi hiệu suất tiền huấn luyện được cải thiện, chúng tôi cũng thấy các mô hình trở nên thông minh hơn nhiều ngay cả khi hoàn toàn không sử dụng suy luận được diễn đạt bằng lời.
Những thách thức này không hẳn là không thể vượt qua. Tôi hy vọng chúng ta có thể phát triển các biện pháp can thiệp để cải thiện khả năng giám sát chuỗi tư duy của các mô hình, chẳng hạn bằng cách hiểu rõ hơn sự tương tác giữa các mục tiêu tối ưu hóa khác nhau và những dạng năng lực tính toán ở thời điểm kiểm thử mà mô hình sử dụng. Tôi cũng tin rằng việc kết hợp các ý tưởng từ giám sát CoT và giám sát kích hoạt có thể mang lại giá trị lớn — mở rộng quy mô huấn luyện các trình giám sát có quyền truy cập trực tiếp vào cấu trúc nội tại của mạng, chẳng hạn như lời thú nhận(mở trong cửa sổ mới). Chúng tôi đang tích cực theo đuổi những ý tưởng này. Dẫu vậy, tôi dự đoán tiến bộ chung của AI sẽ ngày càng bị giới hạn bởi mức độ tin cậy vào hoạt động giám sát.
Lập luận thuyết phục nhất mà tôi thấy cho việc tiếp tục nhanh chóng huấn luyện các mô hình thông minh hơn nhiều là nhu cầu xây dựng những hệ thống phòng vệ trước hiểm họa do các AI khác gây ra.
Một rủi ro rõ ràng được thảo luận xuyên suốt năm nay liên quan đến an ninh mạng: các mô hình đang đạt năng lực vượt trội con người trong việc xâm nhập và thoát khỏi các hệ thống máy tính. Điều này mở rộng đáng kể phạm vi rủi ro liên quan đến AI: các tác nhân sẽ có thể truy cập mọi cơ sở hạ tầng, trừ những nơi an toàn nhất, và trực tiếp tác động đến phần lớn thế giới ngay cả khi không có cơ thể vật lý. Hiện tại, chúng ta chỉ có một khoảng thời gian ngắn để dùng các mô hình tốt nhất hiện có nhằm tăng cường đáng kể an ninh cho những hệ thống trọng yếu.
Đáng tiếc là từ đây, các rủi ro liên quan đến AI sẽ tiếp tục gia tăng. Một tác nhân có năng lực rất cao, được huấn luyện và chỉ thị rõ ràng để thực hiện hành vi bất chính, sẽ tạo ra một dạng nguy hiểm mới; nó có khả năng vượt khỏi phạm vi ý định của trình vận hành và khái quát hóa thành hành vi có thể còn độc hại hơn nhiều. Ranh giới giữa việc lạm dụng và hành động tự chủ lệch chuẩn sẽ mờ dần khi AI có thêm quyền tự chủ. Chúng ta có thể quen coi AI là công cụ, nhưng một số tác nhân sẽ theo đuổi mục tiêu riêng. Chúng sẽ tìm cách hợp tác với con người bằng cách thương lượng, lừa gạt hoặc tống tiền họ.
Ngoài ra còn có những rủi ro từ các công nghệ mới mà AI có thể tạo điều kiện phát triển, chẳng hạn như mầm bệnh được thiết kế.
Chúng ta sẽ cần AI mạnh mẽ và được căn chỉnh để phòng vệ: bảo vệ cơ sở hạ tầng, chống lại các tác nhân bất hảo theo thời gian thực và phát minh những biện pháp bảo vệ hoàn toàn mới. Đây sẽ là trọng tâm chính trong các nỗ lực triển khai của OpenAI.
Đồng thời, bất chấp sự bất định do tiến bộ rộng khắp của AI được dự báo và nhu cầu xây dựng các hệ thống phòng vệ, chúng ta không được biến điều đó thành cái cớ cho sự liều lĩnh. Ý tưởng lao về phía trước bằng mọi giá trở nên phi lý khi ta thực sự thấu hiểu mức độ nghiêm trọng của những gì đang bị đe dọa.
Việc trí tuệ máy móc đóng vai trò ngày càng lớn trong chính quá trình phát triển của nó là kết quả tự nhiên của tiến bộ công nghệ bền bỉ. Nếu tiến bộ AI tiếp diễn, khả năng tự cải thiện đệ quy của máy móc (RSI) sẽ nằm ở cốt lõi của hoạt động khám phá khoa học trong tương lai.
Nghiên cứu AI tự động là một hình thức mở rộng trí tuệ bằng năng lực tính toán mang tính đột phá hơn; và dĩ nhiên, trong quá trình đó, AI sẽ cải thiện chính nền tảng tính toán. Tương tự như việc mở rộng quy mô, chúng tôi định hướng nghiên cứu của OpenAI vào RSI vì tin rằng đây là cách duy nhất để tiếp tục đứng ở tuyến tiên phong của nghiên cứu AI.
Tôi muốn nhấn mạnh rằng những điều trên không có nghĩa là tôi cho rằng đẩy nhanh đáng kể nghiên cứu học sâu, nhất là trong ngắn hạn, là hành động tập thể đúng đắn mà cộng đồng nghiên cứu nên thực hiện. Tuy nhiên, tôi thực sự cho rằng con đường hiện tại đang dẫn đến đó, và tất cả chúng ta cần có lựa chọn tỉnh táo về cách tiến bước. Những đòn bẩy chính của chúng ta là định hướng quá trình nhằm đồng thời củng cố khả năng căn chỉnh và giám sát AI, đồng thời tìm cách duy trì sự tham gia của con người; hoặc phối hợp làm chậm quá trình phát triển trong tương lai khi cần để củng cố niềm tin vào các biện pháp này.
Theo tôi, hướng đi tốt nhất hiện nay là kết hợp cả hai.
Những tiến bộ cụ thể mà chúng tôi đạt được về căn chỉnh và giám sát nhìn chung gắn bó rất chặt chẽ với tiến bộ chung của AI. Những ví dụ tiêu biểu là học tăng cường từ phản hồi của con người(mở trong cửa sổ mới), yếu tố then chốt để huấn luyện các trợ lý AI đời đầu, và giám sát chuỗi tư duy(mở trong cửa sổ mới) nói trên, vốn trở nên khả thi nhờ những tiến bộ về mô hình suy luận. Chúng ta phải tập trung quá trình nghiên cứu ngày càng tự động hóa vào việc phát triển những hiểu biết, thuật toán và lý thuyết mới như vậy, đồng thời từng bước xây dựng luận chứng an toàn cho các AI có năng lực cao hơn.
Việc mở rộng quy mô hệ thống AI phải bị giới hạn bởi mức độ tin cậy của chúng ta vào sự an toàn. Chúng ta cần phát triển các cam kết như Khung chuẩn bị hoặc Chính sách mở rộng quy mô có trách nhiệm(mở trong cửa sổ mới) thành những ngưỡng an toàn bắt buộc áp dụng rộng rãi để tiếp tục phát triển. Các ngưỡng này có thể được thực thi bởi mạng lưới kiểm toán viên bên thứ ba, cơ quan chính phủ hoặc tổ chức quốc tế.
Thách thức cốt lõi của việc tự động hóa nghiên cứu AI không phải là “đạt tới đích”, mà là đạt tới đó theo cách giúp con người tiếp tục tham gia quá trình cải thiện và giữ tương lai trong tay nhân loại.
Như chúng tôi gần đây đã trình bày cùng Sam, OpenAI ưu tiên công việc hướng đến ba mục tiêu dẫn đường:
Vượt qua giai đoạn tiến bộ tiếp theo của AI bằng cách xây dựng một nhà nghiên cứu AI tự động, cùng nó liên tục giải quyết bài toán căn chỉnh và tìm cách để con người tiếp tục tham gia vòng lặp tự cải thiện.
Đưa những lợi ích của tiến bộ khoa học và tăng trưởng kinh tế do các cỗ máy cực kỳ thông minh tạo điều kiện đến với mọi người.
Trao quyền cho từng người bằng một AGI cá nhân.
Trong bài luận này, tôi chỉ tập trung vào điểm đầu tiên vì tin rằng đây là vấn đề cấp bách hơn hẳn. Tuy nhiên, tôi vẫn luôn hy vọng sâu sắc và trân trọng những lợi ích mà tiến bộ công nghệ hơn nữa sẽ mang lại. AI được căn chỉnh trong tương lai có thể thúc đẩy khoa học, phát triển các liệu pháp mới và mang lại sự sung túc vật chất trên diện rộng. AI thân thiện và trung thực có thể giúp mọi người vượt qua khó khăn trong cuộc sống, đồng thời cải thiện rõ rệt hạnh phúc và cảm giác viên mãn của họ. OpenAI đang nỗ lực rất nhiều để hiện thực hóa những lợi ích này. Một ví dụ hiện tại khiến tôi tự hào — và được những người thân yêu của tôi đánh giá là hữu ích — là khoản đầu tư sâu rộng vào khả năng cung cấp thông tin sức khỏe của ChatGPT.
Dù triển vọng dài hạn của AI có lớn lao đến đâu, phần lớn sự tập trung của chúng ta vẫn nên dành cho vài năm tới. Chúng ta đang đối mặt với quá trình chuyển đổi sang một thế giới có những cỗ máy thông minh phi thường và cần bảo đảm quá trình đó mang lại kết quả tốt đẹp cho nhân loại. Chúng ta cần tìm cách bảo toàn quyền tự chủ của con người và xác lập giá trị nội tại của việc làm người trong một thế giới nơi AI có thể thực hiện hầu hết mọi nhiệm vụ. Chúng ta cần ngăn chặn tình trạng quyền lực tập trung cực độ trong một thế giới nơi những công việc từng cần hàng nghìn chuyên gia giờ có thể được vài người vận hành một máy tính lớn hoàn thành. Và phải bảo đảm con người vẫn kiểm soát tương lai, không bị bỏ lại phía sau bởi tiến bộ thiếu kiểm soát do một trí tuệ xa lạ vượt trội chúng ta tạo ra.
Hiện tại, tôi tin rằng chưa phòng thí nghiệm nào giải quyết bài toán căn chỉnh và giám sát đủ tốt để có thể tiếp tục mở rộng quy mô một cách có trách nhiệm ở tốc độ tối đa lâu hơn nữa. Tôi kỳ vọng và hy vọng việc tự nguyện giảm tốc sẽ trở nên phổ biến cho đến khi các ngưỡng an toàn chung được thiết lập. Và tôi tin rằng phối hợp quốc tế về quá trình phát triển AI trong tương lai cần trở thành ưu tiên hàng đầu của các chính phủ trên toàn thế giới.
Tác giả
Chú thích cuối trang
- 1
Điều này bao gồm việc mở rộng quy mô tự chơi(mở trong cửa sổ mới), robot học(mở trong cửa sổ mới) và, xét lại thì đáng chú ý nhất, mở rộng quy mô mạng hồi quy để mô hình hóa ngôn ngữ(mở trong cửa sổ mới), tiền thân của hướng nghiên cứu GPT.
- 2


