Tối ưu năng lực lập trình và tác vụ doanh nghiệp đa ngành
Sự kết hợp toàn diện giữa năng lực lập trình, suy luận, xử lý đa phương thức và khả năng duy trì các chuỗi tác vụ dài, nhiều bước giúp Gemini 4 Argon vượt trội trong mọi quy trình vận hành của doanh nghiệp.
Các kỹ sư Google đã ứng dụng Argon vào công việc hằng ngày, từ gỡ lỗi thường nhật cho đến chuyển đổi mã nguồn quy mô lớn và thiết kế thuật toán. Mô hình thiết lập chuẩn mực hiệu năng mới trên thước đo DeepSWE v1.1 với điểm số 77,9%, minh chứng cho khả năng xử lý các tác vụ kỹ thuật phần mềm dài hạn trong môi trường thực tế.
Không chỉ dừng lại ở lập trình, Argon còn là mô hình dẫn đầu trên Vals Index — thước đo tác động kinh tế trên các lĩnh vực tài chính, lập trình, pháp lý và thuế, trong đó mỗi lĩnh vực được tính trọng số theo tỷ lệ đóng góp vào GDP Hoa Kỳ. Chúng tôi cũng ghi nhận hiệu năng dẫn đầu tương tự trên các bài đánh giá chuyên sâu khác, bao gồm Vals Finance Agent v2 (nghiên cứu tài chính đa bước) và Harvey’s Legal Agent Benchmark (nghiên cứu và soạn thảo văn bản pháp lý). Trên AutomationBench — bộ đánh giá của Zapier đo lường khả năng triển khai toàn bộ quá trình của các nghiệp vụ cốt lõi — Argon đứng vị trí số 1 với số điểm 51,3%.
Argon cũng đặc biệt mạnh mẽ khi xử lý các công việc tri thức đòi hỏi sự thấu hiểu về mặt thị giác. Mô hình có thể phân tích biểu đồ chuyên nghiệp, nhận diện các chi tiết cụ thể từ video có thời lượng dài và đưa ra hành động dựa trên một chuỗi các tài liệu phức tạp. Đơn cử, trên thước đo LVBench đánh giá khả năng hiểu video dài, Argon đạt mức đỉnh cao mới với số điểm 91,7%.
Dẫn đầu trong phòng thủ an ninh mạng
Nhằm trang bị tốt hơn cho các chuyên gia an ninh mạng trước kỷ nguyên tấn công mạng mới, chúng tôi đã huấn luyện Gemini 4 Argon sở hữu năng lực phòng thủ chuyên sâu. Argon có khả năng tự chủ tìm kiếm, xác thực và vá các lỗ hổng phần mềm nghiêm trọng. Đối với các đối tác an ninh mạng đáng tin cậy và các đội ngũ nội bộ tại Google, chúng tôi sẽ phát hành phiên bản Argon chuyên dụng đã được mở khóa các bộ lọc phòng thủ mạng để họ có thể tận dụng toàn diện năng lực phòng thủ an ninh mạng tiên phong này.
Wiz hiện đã ứng dụng Argon cho phòng thủ an ninh mạng thông qua sáng kiến Scan for Good — chương trình phi lợi nhuận chuyên bảo vệ cơ sở hạ tầng công cộng trọng yếu bằng cách phát hiện và khắc phục các nguy cơ bảo mật. Trong một thử nghiệm ban đầu chứng minh tác động thực tế, mô hình đã phát hiện ra một lỗ hổng nghiêm trọng làm lộ thông tin cá nhân nhạy cảm trong phần mềm y tế được sử dụng tại các bệnh viện trên toàn cầu — một rủi ro đặc biệt nghiêm trọng mà các mô hình tiên phong trước đây đã bỏ sót.
Trên thước đo CWE-bench v1 đánh giá khả năng khắc phục các lỗ hổng bảo mật, Argon cùng xếp hạng nhất với điểm số dẫn đầu 68%, tiếp nối hiệu năng tiên phong mà mô hình 3.8 Flash Cyber đã đạt được trên CWE-bench v0.

Gemini 4 Argon thể hiện những bước nhảy vọt ấn tượng trong việc phát hiện lỗ hổng bảo mật so với phiên bản 3.8 Flash Cyber. Cụ thể:
- Trên bài kiểm tra toàn diện về lỗ hổng bảo mật nội bộ của Google, Argon đã phát hiện nhiều điểm phơi nhiễm nguy cơ trên các mã nguồn phức tạp thuộc 20 ngôn ngữ lập trình khác nhau.
- Trên thước đo kiểm thử xâm nhập hộp đen nội bộ của Wiz — bài kiểm tra năng lực phân tích các hệ thống web thực tế mà không cần mã nguồn — Argon vượt trội hơn 3.8 Flash Cyber trong việc khám phá bề mặt tấn công, nhận diện lỗ hổng và tạo ra bằng chứng thực nghiệm để xác thực các lỗ hổng đó.

Tăng cường các biện pháp an toàn tiên phong trước khi phát hành rộng rãi
Trước khi đưa Gemini 4 Argon vào sử dụng trên diện rộng, chúng tôi tiếp tục củng cố các biện pháp bảo vệ an toàn trọng yếu trên bốn khía cạnh chính:
Phòng chống lạm dụng: Để ngăn chặn kẻ xấu lợi dụng Argon vào các cuộc tấn công mạng hoặc tấn công hóa học, sinh học, phóng xạ và hạt nhân, mô hình được thiết kế để từ chối các yêu cầu gây hại, đồng thời vẫn bảo vệ các nghiên cứu khoa học lưỡng dụng hợp pháp, tuân thủ theo
Khung An toàn Tiên phong. Chúng tôi đang tăng cường độ vững chắc của các rào chắn an toàn cho đợt ra mắt này, bao gồm cải tiến các kỹ thuật giám sát
kích hoạt nội bộ của mô hình nhằm phát hiện sớm hành vi lạm dụng. Các biện pháp này đã vượt qua các đợt kiểm thử đối kháng bởi các đội ngũ chuyên gia nội bộ và độc lập bên ngoài thông qua việc kết hợp các phương thức tấn công thủ công và tự động.
Phòng chống các cuộc tấn công chèn câu lệnh: Argon cũng là mô hình có khả năng chống chịu tốt nhất từ trước đến nay của chúng tôi trước các cuộc tấn công chèn câu lệnh gián tiếp (indirect prompt injections) — hình thức mà các câu lệnh hoặc ngữ cảnh độc hại được cài cắm nhằm chiếm quyền điều khiển hành vi của mô hình. Đây là các cuộc tấn công phức tạp đòi hỏi sự cảnh giác liên tục và nhiều lớp phòng thủ. Thông qua việc kiểm thử đối kháng tự động và huấn luyện đối kháng, Gemini 4 Argon dẫn đầu về độ bền vững trước tấn công chèn câu lệnh trên thước đo Gray Swan Indirect Prompt Injection (IPI).

Giám sát sai lệch định hướng: Nhằm ngăn ngừa việc Argon đi chệch khỏi giới hạn an toàn khi cố gắng hoàn thành tác vụ theo cách không đúng với chủ đích của người dùng, chúng tôi đang triển khai các giải pháp giảm thiểu sai lệch nhằm giám sát chuỗi tư duy cũng như các hành động của Argon, đồng thời dừng thực thi ngay khi cần thiết.
Chúng tôi đã áp dụng một hệ thống tương tự để giám sát các phiên huấn luyện và gửi cảnh báo đến đội ngũ ứng phó sự cố chuyên trách, đồng thời thực hiện các biện pháp phòng ngừa nghiêm ngặt nhằm tránh đưa các phát hiện này quay trở lại quá trình huấn luyện, nhằm không làm thay đổi cách lập luận của Argon để né tránh sự giám sát. Chúng tôi
kêu gọi toàn ngành công nghệ cùng chung tay bảo toàn tính minh bạch trong quá trình lập luận trong giai đoạn phát triển năng lực AI then chốt này, giúp quá trình suy nghĩ của mô hình luôn là công cụ hữu ích để nhận diện và chẩn đoán sự sai lệch định hướng.
Tăng cường phòng thủ hệ thống: Khi các mô hình tiên phong ngày càng trở nên mạnh mẽ, việc thử nghiệm an toàn đòi hỏi những môi trường bảo mật có khả năng thích ứng tương xứng. Phù hợp với
lộ trình kiểm soát tác nhân, chúng tôi đang củng cố các môi trường hộp cát (sandboxed environments) bằng cách cách ly và niêm phong chặt chẽ trước khi tiến hành các phiên huấn luyện hoặc đánh giá rủi ro cao. Chúng tôi cam kết chia sẻ các phương pháp thực hành bảo mật tác nhân AI tối ưu này với các đối tác nhằm nâng cao tính an toàn cho toàn bộ hệ sinh thái.
Sắp ra mắt rộng rãi
Chúng tôi xây dựng Gemini 4 Argon với các năng lực tiên phong về lập trình, công việc tri thức, phòng thủ an ninh mạng và sáng tạo nội dung nhằm trở thành người bạn đồng hành tin cậy cho các nhà phát triển, chuyên gia và doanh nghiệp trên hành trình chinh phục những thách thức phức tạp nhất. Chúng tôi vô cùng trân trọng nhóm chuyên gia an ninh mạng và những người thử nghiệm đáng tin cậy ban đầu, những đánh giá thực tế và phản hồi quý báu của họ sẽ giúp chúng tôi không ngừng hoàn thiện hệ thống trước khi chính thức phát hành rộng rãi tới cộng đồng nhà phát triển, doanh nghiệp và người dùng — bắt đầu với khách hàng sử dụng API trả phí và người dùng đăng ký gói Google AI Ultra.
Không có nhận xét nào :
Đăng nhận xét