Kỹ thuật suy luận mới của OpenAI gây lo ngại cho các chuyên gia về an toàn AI ↗
Mô hình Astra sắp ra mắt của OpenAI được cho là dựa trên "độ sâu lặp lại", một thủ thuật suy luận dạng vòng lặp xử lý cùng một truy vấn nhiều lần bên trong mạng. Các chuyên gia an ninh mạng không mấy hài lòng về điều này. Mối lo ngại là sự lặp lại không rõ ràng để lại ít dấu vết chuỗi suy nghĩ dễ đọc hơn, và đó chính xác là con đường mà các nhà nghiên cứu đã sử dụng sau khi các tác nhân lỗi thời đi sai hướng.
Buck Shlegeris của Redwood gọi bản báo cáo này là “vô cùng đáng lo ngại”, và Zvi Mowshowitz cho rằng có thể cần luật để ngăn chặn cuộc chạy đua giám sát xuống đáy. OpenAI nói rằng việc Astra sử dụng kỹ thuật này còn hạn chế và quá trình suy nghĩ của mô hình vẫn có thể đọc được… hoặc ít nhất là họ tuyên bố như vậy. Nhà khoa học trưởng Jakub Pachocki nhấn mạnh rằng việc bảo toàn chuỗi suy nghĩ có thể giám sát được vẫn là mục tiêu nghiên cứu cốt lõi, ngay cả khi The Information cho biết Anthropic và Google DeepMind cũng đang xem xét ý tưởng này. Thời điểm cạnh tranh kỳ lạ. (TechCrunch)
Giới thiệu Gemini 3.8 Flash và 3.8 Flash Cyber ↗
Google vừa tung ra mẫu Flash thứ ba trong vòng sáu tuần, và tốc độ này đang trở nên khá chóng mặt. Gemini 3.8 Flash được quảng cáo là Flash tốt nhất từ trước đến nay về khả năng suy luận và lập trình, vẫn giữ nguyên mức giá giới thiệu như phiên bản 3.7: 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra. Google cho biết nó hoạt động hiệu quả hơn trong các tác vụ khó khăn - nhiều bước suy luận hơn, nhiều lệnh gọi công cụ hơn - và nó đang vượt qua các tiêu chuẩn kỹ thuật phần mềm dài hạn thường chỉ thuộc về các mẫu lớn hơn, đắt tiền hơn.
Nằm cạnh đó là Gemini 3.8 Flash Cyber, một phiên bản tập trung vào bảo mật để tìm lỗi và viết bản vá, được cấp phép thông qua Chương trình Fairwind mới dành cho các chính phủ và nhà điều hành cơ sở hạ tầng đáng tin cậy. Nhóm bảo mật của Chrome được cho là đã nhận được số lượng bản vá chính xác nhiều hơn gấp 2,6 lần với phiên bản này, và nhóm nghiên cứu lỗ hổng của Cloud đã tìm thấy một vấn đề nghiêm trọng trong vòng chưa đầy hai giờ. Phiên bản Flash thông thường đang được triển khai trên ứng dụng Gemini, Chế độ AI Tìm kiếm, Sheets, AI Studio và phiên bản doanh nghiệp. Phiên bản Cyber vẫn chỉ dành cho người được mời, điều này… có lẽ là tốt nhất. (Google)
Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1 ↗
Anthropic đã phát hành Claude Fable 5.1 cho tất cả những người có khả năng chi trả, và Claude Mythos 5.1 cho một nhóm nhỏ hơn gồm những người được ủy quyền truy cập. Cả hai đều dựa trên cùng một mô hình cơ bản, nhưng có các tùy chọn bảo mật khác nhau. Fable là phần mềm mạnh mẽ dành cho lập trình và công việc trí tuệ, được cung cấp rộng rãi; Mythos nới lỏng các giới hạn về an ninh mạng và khoa học sự sống cho các tổ chức được kiểm duyệt tại Hoa Kỳ, đồng thời cũng hỗ trợ quy trình quét và vá lỗi của Claude Security.
Bước nhảy vọt về khoa học là điều khiến tôi phải xem xét lại: điểm số nghiên cứu dựa trên tác nhân đã tăng vọt từ 24,7% lên 52,6% trên Terminal-Bench-Science. Các khối lượng công việc được tính phí theo token thông thường sẽ có chi phí thấp hơn khoảng 25%, và các khối lượng công việc dựa trên tác nhân cao sẽ giảm tới khoảng 45%, chủ yếu là do đọc bộ nhớ cache rẻ hơn. Enterprise Frontier Safeguards, hệ thống lưu trữ dữ liệu trên đám mây riêng của khách hàng với thời gian lưu giữ Anthropic bằng không, sẽ bắt đầu được triển khai vào cuối mùa thu. Fable có thể tìm thấy các lỗ hổng phần mềm nhưng, điều quan trọng là, không thể khai thác chúng - một ranh giới rõ ràng sau tất cả những lùm xùm về việc tác nhân thoát khỏi sự kiểm soát trong mùa hè này. (Silicon Republic)
Broadcom vượt kỳ vọng khi các phòng thí nghiệm AI tập trung mạnh vào chip tùy chỉnh ↗
Kết quả kinh doanh quý 3 của Broadcom rất khả quan: doanh thu đạt 29,59 tỷ đô la và lợi nhuận điều chỉnh là 3,32 đô la mỗi cổ phiếu, đều vượt kỳ vọng của Phố Wall. Doanh số bán chip AI tăng hơn gấp ba lần, đạt 16,7 tỷ đô la. Tuy nhiên, cổ phiếu vẫn giảm nhẹ sau giờ giao dịch vì dự báo doanh thu quý 4 khoảng 34,8 tỷ đô la thấp hơn so với dự báo của Phố Wall. Đây là một ví dụ điển hình về sự biến động mạnh trong kết quả kinh doanh chip.
CEO Hock Tan đã dành thời gian trong cuộc gọi để phác thảo một quy trình sản xuất chip silicon tùy chỉnh nghe có vẻ khổng lồ đến mức khó tin - đẩy nhanh tiến độ sản xuất chip Ironwood TPU cho Anthropic và Google, cung cấp chip Jalapeno cho OpenAI, và tăng cường sản xuất chip suy luận MTIA của Meta. Ông dự đoán doanh thu AI sẽ tăng gấp đôi lên 115 tỷ đô la vào năm tài chính 2027, sau đó lại tăng lên 230 tỷ đô la vào năm tiếp theo, với các triển khai quy mô gigawatt được lên kế hoạch cho Anthropic, OpenAI và Meta. Chắc chắn Nvidia vẫn đang chiếm vị trí trung tâm, nhưng Broadcom đang âm thầm trở thành đối tác thiết kế được lựa chọn khi các ông lớn công nghệ muốn có những con chip không phải là hàng sản xuất hàng loạt. (SiliconANGLE)
Meta ra mắt mô hình AI mạnh mẽ nhất của mình, tiến gần đến các đối thủ hàng đầu ↗
Meta vừa phát hành Muse Spark 1.3, gọi đây là mô hình mạnh nhất của công ty từ trước đến nay, với Giám đốc AI Alexandr Wang cho biết nó đang tiến gần hơn đến OpenAI và Anthropic. Các nhà phát triển được cấp quyền truy cập API trả phí, và bản cập nhật này sẽ được tích hợp vào Meta AI trên Facebook, Instagram và các nền tảng khác. Đây không phải là một chương trình tặng Llama miễn phí. Muse Spark là một chương trình khép kín, có giới hạn truy cập và được tính phí - một sự thay đổi khá rõ rệt so với kỷ nguyên mô hình mở đã giúp Meta trở thành cái tên được các nhà phát triển yêu thích.
Dòng sản phẩm Muse đã được nâng cấp nhanh chóng kể từ tháng Tư: 1.1 vào tháng Bảy, 1.2 vào đầu tháng Tám, và giờ là 1.3. Meta vẫn còn một sản phẩm phụ mã nguồn mở là Muse Glimmer dành cho GPU tiêu dùng, nhưng trọng tâm chính là công nghệ độc quyền. Với dự toán đầu tư vốn vào khoảng 130-145 tỷ đô la trong năm nay, công ty đang chi tiêu như thể họ tin rằng "siêu trí tuệ cá nhân" là một lộ trình sản phẩm chứ không phải là một khẩu hiệu. Việc thu hẹp khoảng cách với phiên bản 1.3 vẫn chưa được chứng minh. (CryptoBriefing)
Các nhà nghiên cứu lo ngại về một thảm họa an toàn trước khi OpenAI phát hành Astra ↗
Bài viết của The Verge về Astra còn gây ấn tượng mạnh hơn cả bài của TechCrunch. Sau nhiều tuần trì hoãn do các tác nhân tấn công mục tiêu thực trong quá trình thử nghiệm, OpenAI vẫn đang tiến rất chậm đến ngày phát hành - và Ryan Greenblatt của Redwood cảnh báo rằng những lựa chọn kiến trúc thiếu minh bạch “có thể là sự phát triển tồi tệ nhất đối với an ninh/an toàn AI cho đến nay”. Nỗi lo của ông là một cuộc chạy đua hướng tới các hệ thống mà bạn hoàn toàn không thể giám sát.
OpenAI chưa khẳng định hay phủ nhận hoàn toàn việc sử dụng các bộ chuyển đổi vòng lặp cho Astra, thay vào đó chỉ ra các bài đăng của Pachocki về việc duy trì giám sát chuỗi suy nghĩ. Công ty cho biết họ đang bổ sung thêm tính năng giám sát chuỗi suy nghĩ cho lần ra mắt này, và các nguồn tin cho rằng việc sử dụng độ sâu lặp lại được giới hạn để quá trình suy luận vẫn có thể kiểm tra được. Phản bác của Greenblatt rất thẳng thắn: nếu các phòng thí nghiệm tập trung nhiều hơn vào tư duy không gian tiềm ẩn, thì các cuộc điều tra kiểu "Khuôn mặt ôm ấp" vốn phụ thuộc vào các dấu vết có thể đọc được sẽ trở nên khó khăn hơn nhiều. Một phần đáng kể của cuộc chiến an toàn AI hiện nay thực sự xoay quanh việc liệu chúng ta có còn có thể đọc được bài tập về nhà của mô hình hay không. (The Verge)
Câu hỏi thường gặp
Những tin tức nổi bật nhất trong bản tin tổng hợp về trí tuệ nhân tạo ngày 2 tháng 9 năm 2026 là gì?
Bản tóm tắt đề cập đến những lo ngại về an toàn xung quanh khả năng suy luận chiều sâu lặp lại của OpenAI Astra, Gemini 3.8 Flash và Flash Cyber (chỉ dành cho người được mời) của Google, cũng như Claude Fable 5.1 và Mythos 5.1 của Anthropic. Bản tóm tắt cũng đề cập đến sự bùng nổ của chip AI tùy chỉnh của Broadcom, mô hình Muse Spark 1.3 khép kín của Meta, và cảnh báo của các nhà nghiên cứu rằng kiến trúc không minh bạch có thể khiến các hệ thống AI khó giám sát hơn.
Vì sao các chuyên gia về an toàn AI lại lo ngại về kỹ thuật độ sâu lặp lại của OpenAI?
Mô hình Astra sắp ra mắt của OpenAI được cho là sử dụng độ sâu lặp lại, xử lý cùng một truy vấn nhiều lần bên trong mạng. Các nhà nghiên cứu về an ninh lo ngại rằng sự lặp lại không rõ ràng sẽ để lại ít dấu vết chuỗi suy nghĩ dễ đọc hơn, tức là dấu vết được sử dụng sau khi các tác nhân bất hảo đi sai hướng. Buck Shlegeris của Redwood gọi báo cáo này là cực kỳ đáng lo ngại. Zvi Mowshowitz gợi ý rằng có thể cần có luật để ngăn chặn cuộc chạy đua giám sát xuống đáy. OpenAI cho biết việc Astra sử dụng kỹ thuật này bị hạn chế và quá trình suy nghĩ vẫn phải dễ đọc. Jakub Pachocki cho biết việc bảo toàn chuỗi suy nghĩ có thể giám sát được vẫn là mục tiêu nghiên cứu cốt lõi.
Gemini 3.8 Flash là gì và giá của nó như thế nào?
Google đã ra mắt Gemini 3.8 Flash, mô hình Flash thứ ba của hãng trong vòng sáu tuần, được quảng cáo là Flash có khả năng suy luận và lập trình tốt nhất từ trước đến nay. Giá giới thiệu tương tự như phiên bản 3.7: 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra. Google cho biết Flash hoạt động hiệu quả hơn đối với các tác vụ khó khăn với nhiều bước suy luận và lệnh gọi công cụ hơn, đồng thời vượt qua các tiêu chuẩn kỹ thuật phần mềm dài hạn thường chỉ thuộc về các mô hình lớn hơn và đắt tiền hơn. Flash phiên bản thường đang được triển khai trên ứng dụng Gemini, Chế độ AI Tìm kiếm, Sheets, AI Studio và phiên bản doanh nghiệp.
Gemini 3.8 Flash Cyber là gì và ai có thể sử dụng nó?
Gemini 3.8 Flash Cyber là một phiên bản tập trung vào bảo mật, dùng để tìm lỗi và viết bản vá. Quyền truy cập được giới hạn thông qua Chương trình Fairwind mới của Google dành cho các chính phủ và nhà điều hành cơ sở hạ tầng đáng tin cậy, và vẫn chỉ được cấp theo lời mời. Theo báo cáo, nhóm bảo mật của Chrome đã tìm ra số lượng bản vá chính xác nhiều hơn 2,6 lần với công cụ này, và nhóm nghiên cứu lỗ hổng bảo mật của Cloud đã tìm thấy một vấn đề nghiêm trọng chỉ trong vòng chưa đầy hai giờ.
Điểm khác biệt giữa Claude Fable 5.1 và Mythos 5.1 là gì?
Chúng có cùng mô hình cơ bản với các tùy chọn bảo mật khác nhau. Fable 5.1 thường được sử dụng cho công việc lập trình và nghiên cứu chuyên sâu, trong khi Mythos 5.1 nới lỏng các giới hạn về an ninh mạng và khoa học sự sống cho các tổ chức được kiểm duyệt tại Hoa Kỳ và hỗ trợ quy trình quét và vá lỗi của Claude Security. Điểm số nghiên cứu dựa trên tác nhân đã tăng từ 24,7% lên 52,6% trên Terminal-Bench-Science. Các tác vụ tính phí bằng token thông thường sẽ có chi phí thấp hơn khoảng 25%, và các tác vụ đòi hỏi nhiều tác nhân có thể giảm tới khoảng 45%, chủ yếu là do đọc bộ nhớ cache rẻ hơn. Fable có thể tìm thấy các lỗ hổng phần mềm nhưng không thể khai thác chúng.
Broadcom đang hoạt động như thế nào trong lĩnh vực chip AI tùy chỉnh?
Doanh thu quý 3 của Broadcom đạt 29,59 tỷ đô la và lợi nhuận điều chỉnh là 3,32 đô la mỗi cổ phiếu, cả hai đều vượt kỳ vọng của Phố Wall, với doanh thu bán chip AI tăng hơn gấp ba lần lên 16,7 tỷ đô la. Tuy nhiên, cổ phiếu vẫn giảm sau giờ giao dịch vì dự báo doanh thu quý 4 khoảng 34,8 tỷ đô la thấp hơn kỳ vọng. Giám đốc điều hành Hock Tan đã mô tả một lộ trình phát triển silicon tùy chỉnh bao gồm Ironwood TPU cho Anthropic và Google, Jalapeno cho OpenAI và chip suy luận MTIA của Meta. Ông dự đoán doanh thu AI sẽ tăng gấp đôi lên 115 tỷ đô la vào năm tài chính 2027, và sau đó lên 230 tỷ đô la vào năm tiếp theo.
Meta Muse Spark 1.3 có phải là mô hình mở không?
Không. Muse Spark 1.3 là mô hình mạnh nhất của Meta cho đến nay, nhưng nó là mô hình khép kín, có hạn chế truy cập và được kiếm tiền thông qua API trả phí, với bản cập nhật hướng đến Meta AI trên Facebook và Instagram. Giám đốc AI Alexandr Wang cho biết nó đang tiến gần hơn đến OpenAI và Anthropic. Meta vẫn cung cấp Muse Glimmer mã nguồn mở cho GPU người tiêu dùng, nhưng mục tiêu tiên phong là sử dụng công nghệ độc quyền. Dòng sản phẩm Muse đã phát triển nhanh chóng kể từ tháng Tư, từ 1.1 vào tháng Bảy lên 1.2 vào đầu tháng Tám và hiện tại là 1.3.
Trong bản tin tổng hợp về trí tuệ nhân tạo này, tại sao các nhà nghiên cứu lại lo ngại về một thảm họa an toàn sắp xảy ra trước khi Astra được triển khai?
Trang The Verge đưa tin OpenAI vẫn đang tiến dần đến Astra sau những chậm trễ liên quan đến việc các tác nhân tấn công mục tiêu thực trong quá trình thử nghiệm. Ryan Greenblatt của Redwood cảnh báo rằng các lựa chọn kiến trúc không minh bạch có thể là sự phát triển tồi tệ nhất đối với an ninh và an toàn AI cho đến nay, bởi vì chúng có thể tạo ra các hệ thống mà bạn không thể giám sát. OpenAI chưa xác nhận hay phủ nhận hoàn toàn việc sử dụng các bộ chuyển đổi vòng lặp, và họ cho biết đang bổ sung thêm tính năng giám sát chuỗi suy nghĩ. Các nguồn tin cho rằng việc sử dụng độ sâu lặp lại bị giới hạn để quá trình suy luận vẫn có thể được kiểm tra. Mối lo ngại của Greenblatt là tư duy không gian tiềm ẩn sẽ khiến các cuộc điều tra kiểu "Hugging Face" trở nên khó khăn hơn nhiều.