Bài này là bản dịch tiếng Việt (sát nghĩa) thông báo gốc của Anthropic: Redeploying Claude Fable 5 (30/06/2026). Tên model và thuật ngữ kỹ thuật giữ nguyên gốc. Mọi quyền thuộc về Anthropic; bài dịch chỉ nhằm mục đích tham khảo.
Cập nhật (01/07/2026): Fable 5 và Mythos 5 đã được tái triển khai
Quyền truy cập Claude Fable 5 và Mythos 5 nay đã được khôi phục.
Vào thứ Sáu, ngày 12 tháng 6, chính phủ Mỹ áp dụng biện pháp kiểm soát xuất khẩu (export controls) đối với các model mới nhất của chúng tôi là Claude Fable 5 và Claude Mythos 5. Điều này buộc chúng tôi phải hạn chế quyền truy cập đối với công dân nước ngoài, bất kể họ ở trong hay ngoài lãnh thổ Mỹ. Vì lệnh có hiệu lực ngay lập tức và chúng tôi không có cách nào đáng tin cậy để xác minh quốc tịch theo thời gian thực, chúng tôi đã tạm ngưng quyền truy cập cả hai model đối với toàn bộ người dùng.
Tính đến hôm nay, ngày 30 tháng 6, các biện pháp kiểm soát xuất khẩu đối với Fable 5 và Mythos 5 đã được gỡ bỏ.
Fable 5 sẽ khả dụng bắt đầu từ ngày mai, thứ Tư, ngày 1 tháng 7, cho người dùng trên toàn cầu qua Claude Platform, Claude.ai, Claude Code và Claude Cowork. Với các gói Pro, Max, Team và một số gói Enterprise nhất định, Fable 5 sẽ được bao gồm cho tối đa 50% giới hạn sử dụng hằng tuần đến hết ngày 7 tháng 7, sau đó sẽ khả dụng thông qua usage credits. Chúng tôi sẽ mở lại quyền truy cập trên AWS, Google Cloud và Microsoft Foundry sớm nhất có thể.
Chúng tôi cũng đã khôi phục quyền truy cập Mythos 5 cho một nhóm tổ chức tại Mỹ, sau khi được chính phủ Mỹ chấp thuận vào ngày 26 tháng 6. Chúng tôi tiếp tục phối hợp với chính phủ để mở rộng quyền truy cập cho nhóm đối tác trong và ngoài nước rộng hơn thuộc chương trình Glasswing.
Trong phần còn lại của bài viết này, chúng tôi trình bày thêm chi tiết và cập nhật ở bốn mảng:
- Dòng thời gian các sự kiện, gồm cả những cập nhật chúng tôi đã thực hiện với safeguard. Chúng tôi bàn về các sự kiện dẫn tới chỉ thị kiểm soát xuất khẩu và cách chúng tôi xử lý bằng những safeguard mới.
- Cách tiếp cận chung của chúng tôi với safeguard. Chúng tôi cung cấp thêm bối cảnh về cách chúng tôi dùng safety classifier để phát hiện những hành vi sử dụng model tiềm ẩn nguy hiểm trong lĩnh vực an ninh mạng.
- Một khung tiêu chuẩn chung cho cả ngành. Dù đã đạt được một giải pháp mang tính xây dựng, những sự kiện này cho thấy rõ rằng ngành cần một cách nhất quán để đánh giá và khắc phục các “jailbreak” tiềm ẩn của model AI (những kỹ thuật vượt qua safeguard của một model). Một tiêu chuẩn chung để phán định mức độ nghiêm trọng của một jailbreak sẽ giúp các đơn vị phát triển AI phân loại ưu tiên các phát hiện mới khi chúng xuất hiện, ra mắt những model có năng lực cao với độ an toàn tốt hơn, và truyền đạt mức độ rủi ro một cách nhất quán tới các đối tác chính phủ và ngành. Cùng với Amazon, Microsoft, Google và các đối tác Glasswing khác, chúng tôi đã bắt đầu xây dựng một khung như vậy, và trình bày phác thảo bên dưới.
- Hợp tác sâu hơn với chính phủ. Chúng tôi cũng đang tăng cường mức độ hợp tác với chính phủ Mỹ về việc kiểm thử trước khi phát hành, chia sẻ thông tin và hợp tác nghiên cứu. Chúng tôi mô tả sự hợp tác sâu hơn này ở phần cuối.
Dòng thời gian và các cập nhật về safeguard
Chúng tôi phát hành Fable 5 và Mythos 5 vào thứ Ba, ngày 9 tháng 6. Cả hai dùng chung một model nền tảng, nhưng Fable 5 được phát hành kèm những safeguard mạnh để an toàn hơn cho mục đích sử dụng phổ thông. Mythos 5, vốn có ít safeguard hơn, chỉ được phát hành cho một số ít đối tác tin cậy thuộc Project Glasswing để dùng trong an ninh mạng phòng thủ.
Chỉ thị kiểm soát xuất khẩu ngày 12 tháng 6 đến sau khi chính phủ biết tới một báo cáo trong đó các nhà nghiên cứu của Amazon phát hiện một phương pháp vượt qua safeguard của Fable 5: đưa prompt để model xác định một số lỗ hổng phần mềm. Trong một trường hợp, model đã tạo ra code minh họa cách khai thác lỗ hổng liên quan. Trong hai tuần qua, chúng tôi đã phối hợp chặt chẽ với chính phủ và các đối tác khác, gồm cả Amazon, để rà soát báo cáo và bằng chứng.
Quá trình kiểm thử của chúng tôi xác nhận rằng nhiều model kém năng lực hơn, gồm Claude Opus 4.8, GPT-5.5 và Kimi K2.7, có thể xác định chính những lỗ hổng mà Fable 5 đã xác định trong báo cáo. Còn với phần minh họa cách khai thác lỗ hổng đơn lẻ đó, mọi model chúng tôi kiểm thử đều có thể tạo ra cùng bản minh họa như Fable 5 (gồm Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5 và Kimi K2.7).
Quan trọng là kỹ thuật được báo cáo không hề để lộ bất kỳ năng lực mạng cấp Mythos đặc thù nào. Hành vi đó phản ánh một trường hợp cận biên (borderline) đối với safeguard của Fable 5. Như chúng tôi sẽ giải thích bên dưới, có một số tác vụ khó có khả năng gây nguy hiểm nhưng vẫn bị safeguard chặn vì thận trọng quá mức. Kỹ thuật được báo cáo cho phép tiếp cận một hành vi như vậy, nhưng nó chỉ liên quan tới công việc an ninh mạng phòng thủ thường quy.
Dù vậy, chúng tôi đã hành động nhanh để xử lý phương pháp vượt qua được báo cáo. Phối hợp chặt chẽ với chính phủ, chúng tôi huấn luyện một safety classifier cải tiến nhắm vào và chặn hành vi được mô tả trong báo cáo. Người dùng sẽ được thông báo nếu một yêu cầu gửi tới Fable 5 bị chặn, và yêu cầu đó sẽ được chuyển sang Opus 4.8 để xử lý thay thế.
Classifier mới nghĩa là kỹ thuật cụ thể được mô tả trong báo cáo của Amazon bị chặn trong hơn 99% trường hợp. Trong một phần rất nhỏ các trường hợp, model có thể cung cấp thông tin không đủ chi tiết để giúp ích cho kẻ tấn công mạng. Như chúng tôi mô tả bên dưới, safeguard của model không được kỳ vọng sẽ chặn mọi năng lực phòng thủ mạng thường quy có rủi ro thấp, mà chỉ chặn những năng lực tiềm ẩn gây hại. Các nhà nghiên cứu thuộc Center for AI Standards and Innovation (CAISI) của Bộ Thương mại Mỹ đã kiểm thử cả safeguard cũ lẫn mới của chúng tôi và đồng ý rằng chúng cực kỳ mạnh.
Classifier mới cũng có cái giá là gắn cờ (flag) các yêu cầu vô hại thường xuyên hơn trong những tác vụ coding và debug thông thường. Như với mọi safeguard, chúng tôi sẽ tiếp tục tinh chỉnh để phân biệt tốt hơn giữa hành vi lạm dụng thực sự và yêu cầu chính đáng, đồng thời giảm số cảnh báo dương tính giả (false positive).
Cách tiếp cận của chúng tôi với safeguard an ninh mạng
Claude Mythos 5 có thể được dùng để tìm và khai thác lỗ hổng phần mềm hiệu quả hơn bất kỳ model nào khác, và hơn cả hầu hết các chuyên gia bảo mật con người trừ nhóm giỏi nhất. Những năng lực an ninh mạng phi thường này khiến nó đặc biệt hấp dẫn với các tác nhân xấu muốn lạm dụng nó trong các cuộc tấn công mạng.
Tuy nhiên, Claude Fable 5 không cung cấp năng lực tấn công đặc thù nào như vậy. Lý do là chúng tôi ra mắt nó với những safeguard mạnh nhất từng áp dụng cho một model. Trong tháng trước khi ra mắt, chúng tôi đã điều chuyển nhân sự từ nhiều nhóm khác nhau trong nội bộ Anthropic để nhân đôi số lượng nhà nghiên cứu và kỹ sư làm việc trên bài toán này.
Fable 5 ra mắt với nhiều cơ chế an toàn, mỗi cơ chế riêng lẻ không tạo được phòng thủ hoàn hảo nhưng khi kết hợp lại khiến model rất khó bị lạm dụng (cách tiếp cận gọi là “defense in depth”, phòng thủ nhiều lớp). Một số cơ chế phòng thủ là huấn luyện model từ chối hỗ trợ những yêu cầu nguy hiểm; số khác là phân tích hồi cứu các mẫu hình lạm dụng.
Một cơ chế an toàn đặc biệt quan trọng liên quan tới classifier, những hệ thống AI tự động nhỏ hơn, có nhiệm vụ trong lúc tương tác phát hiện khi model bị yêu cầu thực hiện một tác vụ an ninh mạng tiềm ẩn gây hại (hoặc tạo ra đầu ra tiềm ẩn gây hại). Khi điều này xảy ra, classifier sẽ chặn không cho model phản hồi yêu cầu. Mục tiêu tối hậu của các classifier này là ngăn model tham gia vào những hành vi nguy hiểm đặc thù.
Như mọi cơ chế an toàn, classifier có thể mắc lỗi. Đôi khi chúng không nhận ra nội dung tiềm ẩn nguy hiểm, và trong một số trường hợp chúng có thể bị “jailbreak” một cách cố ý: người dùng có thể đưa prompt cho model theo những cách bất thường để lừa classifier và khiến model tạo ra đầu ra gây hại lẽ ra hệ thống phải chặn.
Vì thế, chúng tôi cố ý thiết lập safety classifier kích hoạt trên một tập yêu cầu mà chúng tôi biết nhiều khả năng là vô hại. Cách tiếp cận “biên an toàn” (safety margin) này nghĩa là một yêu cầu phải trông rất rõ ràng là an toàn thì mới tránh được việc kích hoạt classifier (xem hàng A trong sơ đồ bên dưới). Người dùng trải nghiệm biên an toàn dưới dạng model từ chối phản hồi một số yêu cầu hợp lý, không gây hại.
Với Fable 5, chúng tôi làm biên an toàn này lớn hơn nhiều so với mọi lần ra mắt trước (hàng B), nghĩa là sẽ có nhiều yêu cầu vô hại hơn bị chặn. Chúng tôi hiểu rằng những dương tính giả kiểu này sẽ gây khó chịu cho người dùng, nhưng chấp nhận đánh đổi vì lợi ích của việc đưa các năng lực khác của model đến rộng rãi với mọi người.
Minh họa về các safety classifier an ninh mạng của chúng tôi.
Khi một yêu cầu được gửi tới model, classifier phát hiện xem yêu cầu đó là vô hại (và được cho phép), hay tiềm ẩn gây hại (và bị chặn). Classifier chặn các yêu cầu mơ hồ (những yêu cầu rõ ràng liên quan tới an ninh mạng nhưng có thể phục vụ mục đích phòng thủ, chẳng hạn tìm lỗ hổng bảo mật) và các yêu cầu gây hại (những yêu cầu rõ ràng nguy hiểm, ví dụ yêu cầu dựng một chuỗi khai thác phần mềm). Như trình bày ở hàng A, chúng tôi còn bao gồm một “biên an toàn”, nơi classifier sẽ chặn cả những yêu cầu nhiều khả năng vô hại nhưng có một xác suất nhỏ gây hại. Điều này làm tăng độ tin cậy rằng mọi yêu cầu gây hại sẽ bị chặn. Với Fable 5 (hàng B), chúng tôi làm biên an toàn còn lớn hơn nữa, nghĩa là nhiều yêu cầu vô hại hơn sẽ bị chặn, nhưng ít yêu cầu thực sự gây hại bị bỏ sót hơn. (“Vulns” = vulnerabilities, lỗ hổng.)
Biên an toàn cũng giúp giảm nhẹ tác động của jailbreak. Nhiều jailbreak có phạm vi hẹp: chúng mở khóa một hành vi rất cụ thể của model chứ không hơn. Trong một số trường hợp, một người dùng giả định có thể jailbreak model theo cách nhỏ nhặt và lấn vào biên an toàn (hoặc đôi khi vào vùng hành vi gây hại mơ hồ), nhưng không chạm tới những hành vi gây hại cốt lõi mà chúng tôi nhắm chặn (hàng C bên dưới). Quan điểm của chúng tôi là các jailbreak của Fable 5 được báo cáo cho tới nay đều thuộc nhóm nhỏ nhặt này.
Những jailbreak nghiêm trọng hơn mở khóa nhiều hành vi gây hại hơn. Jailbreak gây hại hẹp (hàng D) có thể moi ra một số hành vi gây hại cụ thể. Những jailbreak này thường có mức độ nghiêm trọng từ thấp tới trung bình, vì tính hẹp giới hạn kẻ tấn công. Nhóm đáng lo ngại nhất là universal jailbreak (hàng E), loại mở khóa cả một dải rộng các hành vi gây hại.
Cách jailbreak tương tác với các safety classifier của chúng tôi.
Trong trường hợp jailbreak nhỏ nhặt (hàng C), classifier không chặn yêu cầu, nhưng yêu cầu vẫn nằm trong biên an toàn (nên rất khó có khả năng gây hại). Ở jailbreak gây hại hẹp (hàng D), prompt phá qua classifier và mở khóa một hành vi gây hại cụ thể của model. Ở universal jailbreak (hàng E), một prompt mở khóa cả một lớp hành vi gây hại.
Như chúng tôi đã lưu ý khi ra mắt Fable 5, gần như không thể làm cho bất kỳ model AI nào hoàn toàn miễn nhiễm (bất khả xâm phạm) trước jailbreak. Chúng tôi dự liệu rằng một số jailbreak sẽ được tìm ra cho các model của mình, và chúng sẽ khác nhau về mức độ nghiêm trọng: sẽ có nhiều jailbreak nhỏ nhặt, một số jailbreak gây hại hẹp, và dù chưa có universal jailbreak nào cho Fable 5 được phát hiện tại thời điểm viết bài, các nhà nghiên cứu an toàn chuyên môn vẫn đang tiếp tục red-team nó. Chúng tôi hướng tới việc bảo đảm rằng chúng tôi và các đối tác an toàn của mình sẽ là những người đầu tiên tìm ra các jailbreak lớn và vá chúng trước khi tác nhân xấu có thể lợi dụng để gây hại.
Cách tiếp cận thận trọng nêu trên nghĩa là đại đa số jailbreak sẽ không mở khóa được các hành vi nguy hiểm. Classifier của chúng tôi khiến việc jailbreak thành công trở nên rất tốn kém và đòi hỏi nhiều công sức để tạo ra, và ngay cả nếu một jailbreak thành công, các lớp phòng thủ bổ sung của chúng tôi vẫn giảm nhẹ thêm rủi ro. Chúng tôi sẽ tiếp tục cập nhật classifier khi hiểu thêm về những kỹ thuật jailbreak mới lạ.
Một khung đồng thuận toàn ngành cho jailbreak
Hiện chưa có đồng thuận nào trong ngành AI về cách mô tả, bằng những thuật ngữ khách quan, mức độ nghiêm trọng của một jailbreak AI. Điều này tạo ra rất nhiều bất định mỗi khi một kỹ thuật jailbreak mới được phát hiện: các đơn vị phát triển không có tiêu chuẩn thống nhất để biết nên tập trung khẩn cấp vào phát hiện nào, còn các chính phủ không có tiêu chuẩn thống nhất để biết khi nào cần hành động.
Vấn đề này sẽ càng cấp bách hơn trong những tháng tới, khi ngày càng nhiều model có năng lực an ninh mạng (và các năng lực khác) mạnh mẽ được huấn luyện, đánh giá và phát hành. Một tiêu chuẩn chung để đánh giá jailbreak AI sẽ giúp chúng tôi và các công ty khác ra mắt model mới một cách an toàn, đồng thời cho phép người dùng tận dụng tối đa những năng lực tiên tiến của chúng.
Vì thế, chúng tôi đang hợp tác với Amazon, Microsoft, Google và các đối tác Glasswing khác để soạn thảo một khung đồng thuận nhằm đánh giá mức độ nghiêm trọng của jailbreak AI và cách các đơn vị phát triển AI nên phản ứng với chúng. Chúng tôi mời các đối tác trong ngành và các nhà cung cấp model khác cùng tham gia nỗ lực này.
Đề xuất hiện tại của chúng tôi là chấm điểm một jailbreak nhất định theo bốn tiêu chí dưới đây. Hai tiêu chí đầu mô tả những gì jailbreak mang lại cho kẻ tấn công; hai tiêu chí sau mô tả một jailbreak có thể trở thành vấn đề thực tế nhanh tới mức nào:
- Mức tăng năng lực (Capability gain). Jailbreak đưa người dùng vượt xa các công cụ hiện có tới đâu? Nếu các công cụ sẵn có rộng rãi (gồm cả những model AI khác yếu hơn) đã đạt được cùng năng lực như model bị jailbreak, thì điểm ở đây sẽ thấp; nếu jailbreak mở khóa những năng lực model có thể tăng tốc đáng kể ngay cả với chuyên gia trong lĩnh vực, thì điểm sẽ cao.
- Độ rộng của mức tăng năng lực (Breadth of capability gain). Cùng một kỹ thuật jailbreak áp dụng được cho bao nhiêu tác vụ tấn công khác biệt? Các trường hợp jailbreak chỉ cho phép model nhắm tới mục tiêu hẹp sẽ có điểm thấp; các trường hợp cùng một kỹ thuật jailbreak áp dụng được cho nhiều mục tiêu hoặc kỹ thuật khác nhau sẽ có điểm cao.
- Độ dễ vũ khí hóa (Ease of weaponization). Cần bao nhiêu công sức con người để biến jailbreak thành một cuộc tấn công? Nơi jailbreak đòi hỏi rất nhiều kỹ năng đưa prompt và thử đi thử lại nhiều lần, điểm sẽ thấp; nơi jailbreak thành công chỉ với một prompt hoặc ngay lần thử thứ nhất, thứ hai, điểm sẽ cao.
- Độ dễ phát hiện (Discoverability). Người ta lấy được kỹ thuật đó dễ tới đâu? Nếu cần kiến thức chuyên môn thì điểm thấp; nếu nó đã được biết rộng rãi và có sẵn trên mạng thì điểm cao.
Chúng tôi đề xuất dùng khung mức độ nghiêm trọng này để hiệu chỉnh phản ứng với các jailbreak mới được phát hiện. Với nhóm jailbreak nghiêm trọng nhất (ví dụ một jailbreak mà, bên cạnh các đặc điểm khác, đang được dùng để chủ động gây tác động tàn khốc lên các lưới điện trọng yếu hoặc hệ thống ngân hàng), chúng tôi sẽ lập tức bắt đầu triển khai các biện pháp giảm nhẹ sơ bộ ngay khi xác nhận mức độ nghiêm trọng. Chúng tôi cũng đang lập một đội để giám sát 24/7 các kênh gửi jailbreak trọng yếu.
Bất kỳ phương pháp chấm điểm jailbreak nào cũng sẽ không hoàn hảo. Dù vậy, vẫn có giá trị khi có thể truyền đạt mức độ nghiêm trọng gần đúng của một phát hiện qua một khung chung. Đây là công việc đang tiến hành; khi nhận thêm phản hồi từ nhiều đối tác, chúng tôi kỳ vọng khung này sẽ tiến hóa theo thời gian.
Chúng tôi dự kiến sẽ chia sẻ thêm chi tiết về khung đề xuất này trong thời gian tới. Trong lúc đó, chúng tôi cũng đang ra mắt một chương trình HackerOne mới, nơi các nhà nghiên cứu bảo mật có thể gửi những cyber jailbreak tiềm năng họ phát hiện trong Fable 5 (khi model có sẵn) để chúng tôi rà soát.
Hợp tác với chính phủ Mỹ về an ninh AI tiên phong
Trong mười tuần qua, Anthropic đã phối hợp chặt chẽ với chính phủ Mỹ khi họ phát triển cách tiếp cận được phản ánh trong Sắc lệnh Hành pháp ngày 2 tháng 6 về Thúc đẩy Đổi mới và An ninh Trí tuệ Nhân tạo Tiên tiến (Promoting Advanced Artificial Intelligence Innovation and Security). Sự tham gia của chúng tôi trải rộng qua Office of the National Cyber Director, Office of Science and Technology Policy, Department of the Treasury, Department of Commerce (gồm cả CAISI) và các cơ quan an ninh quốc gia liên quan.
Chúng tôi cam kết tiếp tục công việc đó, dựa trên gần hai năm hợp tác sẵn có với các đối tác chính phủ Mỹ về kiểm thử và đánh giá trước triển khai. Các cam kết dưới đây phản ánh cả công việc sẵn có đó lẫn những đề xuất mới của chúng tôi nhằm mở rộng quy mô hợp tác với chính phủ khi khung nói trên được hoàn thiện:
- Quyền truy cập và đánh giá của chính phủ trước phát hành. Với những model tạo ra bước tiến đáng kể về năng lực ở các lĩnh vực liên quan tới an ninh quốc gia, chúng tôi sẽ cấp cho các đối tác chính phủ được chỉ định quyền truy cập sớm mở rộng đối với cả model lẫn các safeguard đi kèm. Các đối tác đó sau đó có thể chạy những đánh giá năng lực độc lập và kiểm thử guardrail của chúng tôi trước khi phát hành rộng rãi. Chúng tôi sẽ cắt cử nhân sự kỹ thuật của Anthropic làm việc song song với các đơn vị đánh giá của chính phủ trong những giai đoạn kiểm thử này.
- Chia sẻ thông tin nhanh về safeguard. Khi các jailbreak đáng kể hoặc mẫu hình lạm dụng được nhận diện, chúng tôi sẽ nhanh chóng điều tra, phân loại và thông báo cho các đối tác chính phủ phù hợp. Chúng tôi sẽ chia sẻ những safeguard mới xây dựng để ứng phó, để chúng có thể được kiểm thử độc lập. Chúng tôi cũng sẽ cung cấp cho các đối tác chính phủ báo cáo tình báo mối đe dọa (threat intelligence) của mình trước khi công bố, và tham gia đầu mối liên ngành về lỗ hổng an ninh mạng (interagency cybersecurity vulnerability clearinghouse) được thiết lập theo Mục 2(d) của Sắc lệnh Hành pháp ngày 2 tháng 6.
- Nguồn lực chuyên biệt cho nghiên cứu chung. Chúng tôi đang mở rộng đáng kể công việc chung với các đối tác chính phủ về an ninh AI. Chúng tôi sẽ thành lập các đội chuyên trách của Anthropic để làm việc trên những ưu tiên chung của chính phủ, cấp một phần đáng kể tài nguyên tính toán (compute) để hỗ trợ việc kiểm thử và nghiên cứu của chính phủ, đồng thời chia sẻ chuyên môn về an toàn và red-teaming để giúp nâng cao trình độ nghệ thuật trong đánh giá AI.
- Một chuẩn mực chung cho toàn ngành. Chúng tôi sẽ làm việc với chính phủ và các đơn vị trong ngành hướng tới một tiêu chuẩn an ninh và đánh giá tự nguyện, dùng chung cho các nhà cung cấp model tiên phong. Chúng tôi sẽ đóng góp các bài đánh giá, công cụ và thực hành tốt nhất để chính phủ có thể áp dụng trên toàn lĩnh vực.
Chúng tôi hy vọng rằng sự hợp tác này, cùng với khung đồng thuận toàn ngành mà chúng tôi đề xuất, sẽ làm nền tảng cho những quy tắc có hệ thống cho cả ngành, và thậm chí phác ra một hình mẫu ban đầu cho việc phối hợp toàn cầu hiệu quả về rủi ro và lợi ích của AI.
Những quy tắc này nên được luật hóa trong quy định chặt chẽ và áp dụng bình đẳng cho tất cả các đơn vị phát triển model tiên phong. Sự tham gia của chính phủ vào các đợt phát hành AI đòi hỏi một quy trình bền vững, minh bạch, mang lại cho các bên phòng thủ mạng và những đối tượng khác sự chắc chắn họ cần về quyền tiếp cận các model mạnh.
Chúng tôi mong được làm sâu sắc thêm hợp tác với chính phủ theo những cách đã mô tả ở trên. Chúng tôi cũng biết ơn người dùng đã cùng chúng tôi vượt qua đợt gián đoạn này, và cảm ơn các nhà nghiên cứu cùng đối tác trong ngành đã sát cánh để đưa Fable 5 và Mythos 5 trở lại.
Chú thích
- Với ghế Enterprise tiêu chuẩn, không có hạn mức Fable 5 đi kèm, dù bạn vẫn có thể truy cập thông qua usage credits. Nếu credits không được bật, người dùng của bạn sẽ không có quyền truy cập Fable 5. Với ghế Enterprise cao cấp, đến hết ngày 7 tháng 7, Fable 5 được bao gồm trong gói đăng ký của bạn. Nó rút từ hạn mức sử dụng của từng ghế thành viên mà không phát sinh chi phí thêm. Sau ngày 7 tháng 7, đội của bạn có thể tiếp tục dùng Fable 5 bằng cách bật usage credits. Nếu credits không được bật, người dùng của bạn sẽ không còn quyền truy cập Fable 5.
- Lưu ý rằng đôi khi thuật ngữ “bypass” được dùng thay cho “jailbreak”. Trong phạm vi bài này, chúng tôi coi chúng là đồng nghĩa, nhưng ở phần còn lại của bài, chúng tôi dùng “jailbreak” vì (a) đây là thuật ngữ được dùng phổ biến hơn và (b) nó nhất quán với thuật ngữ chúng tôi đã dùng trong các công trình trước.
- Tương tự, không có phần mềm nào miễn nhiễm với lỗ hổng (dù nhìn chung, lỗ hổng phần mềm được phát hiện và vá một cách trực diện hơn so với jailbreak của LLM).
- Trong các lĩnh vực nghiên cứu bảo mật khác, đã có những tiêu chuẩn thống nhất: ví dụ, Common Vulnerability Scoring System (CVSS) là một cách phổ biến để đánh giá mức độ nghiêm trọng của một lỗ hổng phần mềm.