Báo Cáo Tổng Quan Phê Phán (Critical Review)

From Language Models to World-Acting Systems

arXiv:2609.04894v1 Cutoff: 31/08/2026 Mục Lục
Tổng hợp toàn diện & sâu sắc về Tiến trình và Giới hạn của Agentic AI

Từ Large Language Models Đến Các World-Acting Systems

Tiến Trình Và Giới Hạn Của Agentic AI Trên Các Môi Trường Kỹ Thuật Số, Xã Hội, Ảo Và Vật Lý

Tác giả: Linsen Zhu, Mengqing Cai • Định danh: arXiv:2609.04894v1 [cs.AI] (Tháng 9/2026)

Luận Điểm Cốt Lõi
Mở Rộng Giao Diện > Tự Chủ Khả Chứng

Độ bao phủ của công cụ và giao diện vượt xa năng lực tự chủ an toàn có thể kiểm chứng độc lập.

Đơn Vị Phân Tích
Hệ Thống S = (M, H, E, U)

Tính tác tử là thuộc tính hợp thành của Model + Harness + Môi trường + Bên ủy quyền.

Độ Tin Cậy Dài Hạn
Thử Thách Độ Tin Cậy τ-bench

Tỷ lệ thành công giảm hàm mũ (pk) qua nhiều bước lặp lại; chuỗi hội thoại trôi chảy không bảo đảm an toàn.

Nguyên Lý Giải Pháp
Ủy Quyền Hợp Thức (Justified Delegation)

Chỉ mở rộng phạm vi khi có bằng chứng về thẩm quyền có ranh giới, kiểm tra lỗi và phục hồi an toàn.

Mục Lục Nhanh: 0. Abstract (Tóm Tắt) 1. Khung Phân Tích & Hệ Thống S 2. Năng Lực Model Đến Tác Tử Cấu Hình (3.1 - 3.3) 3. Hành Động Kỹ Thuật Số (4.1 - 4.4) 4. Giao Thức (MCP vs A2A) & Multi-Agent 5. World Models & Thế Giới Ảo 6. Môi Trường Vật Lý & Robotics 7. Bảo Mật, Quản Trị & Tiêu Chuẩn Báo Cáo 8. Lộ Trình Ủy Quyền Hợp Thức

Tóm Tắt Khoa Học (Abstract) Bản Dịch Chuẩn

arXiv:2609.04894v1 [cs.AI]

Các Large Language Models (LLM) trở thành những agent có tính hệ quả thực tế khi các hệ thống bao quanh cho phép các đầu ra làm thay đổi trạng thái bên ngoài (gọi công cụ, thao tác GUI, ủy quyền công việc, duy trì trạng thái, cư ngụ trong thế giới ảo và điều khiển robot/thiết bị phòng thí nghiệm). Nghiên cứu tổng quan phê phán (critical review) này tổng hợp các công trình sơ cấp và đặc tả kỹ thuật tính đến tháng 8/2026 qua 3 chiều phân tích: Thẩm quyền được ủy nhiệm (Delegated Authority), Tính bền bỉ theo thời gian (Temporal Persistence), và Sự gắn kết môi trường (Environmental Coupling), đồng thời phân định rạch ròi bộ tứ hệ thống S = (M, H, E, U): Mô hình (M), Khung điều phối Harness (H), Môi trường (E) và Người ủy quyền (U). Khảo sát chứng minh việc mở rộng giao diện hành động (action interfaces) đang vượt xa năng lực tự chủ an toàn có thể kiểm chứng độc lập (verifiable autonomy). Các tác giả đề xuất nguyên lý Ủy quyền hợp thức (Justified Delegation): chỉ mở rộng phạm vi hành động khi có bằng chứng thực nghiệm về thẩm quyền có ranh giới, khả năng tự phát hiện lỗi, phục hồi an toàn và kiểm soát được hiệu chuẩn của con người.

Từ khóa cốt lõi: World-Acting Systems System S = (M, H, E, U) Justified Delegation Action-Interface Expansion Verifiable Autonomy τ-bench Reliability
PHẦN 1

Bản Chất Của "Tính Tác Tử": Hệ Thống Hành Động Được Cấu Hình

Giải ảo khái niệm "thang tự chủ" và định nghĩa chuẩn tắc về đơn vị phân tích khoa học

1. Thức Tỉnh Trước Sự Nhầm Lẫn Về "Tính Agentic"

Trong các tài liệu quảng bá và nghiên cứu thương mại, cụm từ "mang tính agent nhiều hơn" (more agentic) thường bị dùng lẫn lộn để chỉ 4 sự thay đổi hoàn toàn khác nhau về bản chất:

01. Model Mạnh Hơn
Base Model Competence

Mô hình suy luận tốt hơn, nhưng tự nó không có thẩm quyền hay công cụ để thay đổi thế giới bên ngoài.

02. Khung Harness Phong Phú
Scaffolding & Tools

Trang bị thêm API, bộ nhớ, cơ chế thử lại và kết nối mạng; không đồng nghĩa với việc model tự suy luận an toàn.

03. Tác Vụ Dài Hơi Hơn
Longer Task Horizons

Chân trời 50% hoàn thành tác vụ dài hơn trong benchmark chỉ là thước đo độ phức tạp, không phải bằng chứng tự chủ bền vững.

04. Môi Trường Hệ Quả Cao
High-Consequence Environment

Trao cho agent quyền ghi cơ sở dữ liệu hoặc điều khiển robot chỉ làm tăng gánh nặng bảo đảm an toàn, không làm tăng trí tuệ.

2. Đơn Vị Phân Tích Chuẩn Tắc: Hệ Thống S = (M, H, E, U)

Một agent không bao giờ tồn tại dưới dạng một model đơn độc. Đơn vị phân tích nhân quả khoa học bắt buộc phải là một Hệ thống hành động được cấu hình (Configured Action System):

BÊN ỦY QUYỀN (U - Delegator) Trao mục tiêu, thẩm quyền & chấp nhận rủi ro MODEL (M) Suy luận, tri giác, dự đoán (Weights & Sampling) HARNESS (H - Khung Điều Phối) Prompt, context, tools, memory, sandbox Quản lý credentials, chính sách lúc thực thi Cơ chế phê duyệt & kiểm soát vận hành MÔI TRƯỜNG (E) Trạng thái số, xã hội, ảo, vật lý (Affordances & Consequences) THẨM ĐỊNH & PHỤC HỒI ĐỘC LẬP (Independent Verification) Kiểm tra kết quả, phát hiện lỗi, tác dụng phụ và nguồn gốc xuất xứ độc lập với model

*Lưu ý quan trọng:* Người vận hành con người (Human Operator) chỉ tương tác qua Harness H; những người và tổ chức bị ảnh hưởng (Affected Parties) nằm bên ngoài hệ thống và phải có quyền được thông báo, khiếu nại và nhận bồi hoàn khi hệ thống gây ra tác động ngoài ý muốn.

PHẦN 2

Từ Năng Lực Model Đến Tác Tử Tính Được Cấu Hình (Configured Agency)

Tổng hợp chi tiết Tiểu mục 3.1, 3.2 và 3.3 từ bài báo gốc của Zhu & Cai (2026)

Chiều Phân Tích 1

Thẩm Quyền Được Ủy Nhiệm (Delegated Authority)

Những thay đổi trạng thái nào mà hệ thống được phép kích hoạt và việc ủy quyền của ai là bắt buộc?

  • Cấp 1: Đưa ra khuyến nghị (Recommendation);
  • Cấp 2: Hành động có thể hoàn tác dưới sự phê duyệt của con người;
  • Cấp 3: Hành động trực tiếp làm thay đổi trạng thái thế giới (Direct state change).
Trọng tâm: Ranh giới chính sách & Thẩm quyền
Chiều Phân Tích 2

Tính Bền Bỉ Theo Thời Gian (Temporal Persistence)

Mục tiêu, bộ nhớ, thông tin chứng thực (credentials) và các nghĩa vụ có tồn tại bền vững qua thời gian?

  • Cấp 1: Phản hồi một lượt (Single turn);
  • Cấp 2: Tác vụ nhiều bước có thể tạm dừng và tiếp tục lại (Resumable);
  • Cấp 3: Nghĩa vụ định kỳ, tồn tại qua nhiều episode, hợp đồng dài hạn.
Trọng tâm: Bộ nhớ, Trạng thái & Thu hồi quyền
Chiều Phân Tích 3

Sự Gắn Kết Môi Trường (Environmental Coupling)

Mức độ trực tiếp mà hành động tác động lên thế giới thực và khả năng đảo ngược hậu quả ra sao?

  • Cấp 1: Trạng thái mô phỏng/cô lập có thể reset (Resettable);
  • Cấp 2: Dịch vụ kỹ thuật số trực tiếp có giới hạn (Live digital services);
  • Cấp 3: Môi trường xã hội & vật lý thực với hậu quả không thể hoàn tác.
Trọng tâm: Rủi ro vật lý & Xã hội không thể reset
Tiểu Mục 3.1

Suy Luận & Sử Dụng Công Cụ: Điều Kiện Cần Nhưng Không Đủ (Necessary but Not Sufficient)

Lý thuyết vs Thực thi

Bước chuyển khái niệm quan trọng nhất của Agentic AI là chuyển dịch từ việc dự đoán câu trả lời sang lựa chọn hành động can thiệp vào môi trường. Ba công trình nền tảng thiết lập vòng lặp cơ bản:

1. ReAct (Yao et al., 2023)

Xen kẽ token suy luận (thought), hành động (action) và quan sát (observation) để chủ động dò tìm thông tin và điều chỉnh quỹ đạo.

2. Toolformer (Schick et al., 2023)

Học tự giám sát xem khi nào cần gọi API và cách nhúng giá trị trả về vào dự đoán tiếp theo.

3. Reflexion (Shinn et al., 2023)

Lưu trữ phản hồi bằng lời (verbal reinforcement) từ thất bại để tự sửa sai trong các lần thử kế tiếp mà không cần tinh chỉnh trọng số mạng.

Khoảng Cách Thực Nghiệm & Bóc Trần Chỉ Số "Chân Trời Hoàn Thành 50%" (Kwa et al., 2025):

• Thách thức thực tế: Vòng lặp ReAct rất dễ vẽ ra trên giấy nhưng cực khó thẩm định trong thực tế: model dễ chọn sai mục tiêu phụ (subgoal), gắn sai đối số vào action schema, bị đánh lừa bởi quan sát thiếu/đối kháng, và không thể đảm bảo tính đúng đắn của các tác dụng phụ (side effects) bên ngoài. Độ chính xác gọi tool (tool accuracy) không đồng nghĩa với việc hành động đã được cấp phép hợp lệ hay kết quả cuối cùng đã đạt được.
• Chỉ số 50%-Task-Completion Time Horizon: Đo khoảng thời gian con người cần để hoàn thành tác vụ mà AI giải được với tỷ lệ 50%. Tác giả Zhu & Cai chỉ rõ: Đây thực chất là đại lượng ước lượng độ phức tạp tác vụ của con người chứ không phải thời gian agent có thể tự vận hành an toàn. Do đó, chân trời dài hơn chỉ là một tuyên bố năng lực (capability claim), hoàn toàn không hỗ trợ cho tuyên bố quyền tự chủ bền vững (durable autonomy).

Tiểu Mục 3.2

Harness Là Một Phần Không Thể Tách Rời Của Hệ Thống Nhân Quả

Causal Architecture

Một language model đơn độc không thể hành động; chính Harness là thành phần biến model thành một hệ thống nhân quả trong thế giới. Sự thành bại của agent phụ thuộc mật thiết vào độ hoàn thiện của Harness:

Thành Phần Harness Khung Tối Thiểu (Minimal Harness) Khung Doanh Nghiệp Thực Tế (Production Harness) Ý Nghĩa Nhân Quả Trong Hệ Thống
Không Gian Hành Động System prompt, khai báo tools thô Sandboxing cô lập, credential broker, token hạn mức Ngăn chặn chiếm quyền, hạn chế bán kính thiệt hại
Quản Lý Ngữ Cảnh & Bộ Nhớ Cắt tỉa cửa sổ token trượt (FIFO) Bộ nhớ phân tầng (L0-L3), vector cache, checkpointing Duy trì trạng thái bền bỉ, chống trôi mục tiêu dài hạn
Kiểm Soát Vận Hành Quy tắc dừng khi gặp thẻ [EOS] hoặc lặp Approval gates, Circuit breaker, retry policy, rollback Bảo đảm an toàn giao dịch, dừng khẩn cấp khi gặp lỗi
Bằng chứng thực nghiệm từ SWE-agent (Yang et al., NeurIPS 2024): Giao diện tương tác Agent-Computer Interface (ACI) cung cấp các lệnh điều hướng kho mã và chỉnh sửa tệp chuyên biệt giúp nâng pass@1 lên 12.5% trên SWE-bench. Điều này chứng minh: Điểm số benchmark không thể gán riêng cho trọng số model, bởi vì việc thiết kế lại bề mặt tương tác của Harness có thể thay đổi hoàn toàn kết quả của cùng một lớp model.
Tiểu Mục 3.3

Ba Ý Nghĩa Có Thể Phân Tách Của Khái Niệm "Hệ Thống Tốt Hơn"

Phân Tách 3 Trục Độc Lập

Bài báo nhấn mạnh sai lầm nghiêm trọng nhất hiện nay là gộp chung mọi cải tiến dưới cái tên mơ hồ "Quyền tự chủ" (Autonomy). Trên thực tế, một hệ thống tốt hơn bắt buộc phải phân tách thành 3 trục cải tiến độc lập:

1. Năng Lực Chính Sách
Policy Competence (Model M)

Model đưa ra quyết định thông minh hơn, chọn hành động chính xác hơn hoặc phục hồi từ phổ lỗi rộng hơn dưới cùng một giao diện cố định.

2. Độ Bao Phủ Hành Động
Action Coverage (Harness H & Env E)

Harness mở rộng thêm nhiều tool, thao tác GUI, tài khoản, dịch vụ bên thứ ba hoặc thiết bị vật lý/robot mới.

3. Mức Độ Bảo Đảm
Assurance (Verification & Containment)

Khả năng phân quyền có ranh giới, thẩm định kết quả độc lập, cô lập sự cố (containment) và phục hồi sau lỗi trở nên đáng tin cậy hơn.

Kết Luận Phê Phán Cốt Lõi Của Bài Báo (Zhu & Cai, 2026):

Việc gộp chung cả 3 cải tiến này dưới nhãn dán "Quyền tự chủ" (Autonomy) tạo ra những so sánh gây hiểu lầm nghiêm trọng. Một coding agent có phạm vi hẹp với các bài kiểm thử tự động và Git diff kiểm toán được sẽ thẩm định được mức độ an toàn cao hơn nhiều so với một model tổng quát mạnh đang tự do điều khiển chuột/phím trên tài khoản trực tiếp. Tốc độ mở rộng độ bao phủ hành động (Action Coverage) bắt buộc phải tương thích và được hỗ trợ đầy đủ bởi năng lực thực tế và các cơ chế bảo đảm an toàn (Assurance).

PHẦN 3

Hành Động Kỹ Thuật Số: Từ Typed APIs Đến Universal Computer Use

Tóm tắt nhanh ý trọn vẹn 4 tiểu mục: 4.1, 4.2, 4.3 và 4.4 của tài liệu gốc

Tiểu Mục 4.1 Typed APIs & Tools

Công Cụ Có Cấu Trúc: Khả Năng Tương Tác Hẹp & Dễ Thanh Tra

API là giao diện hành động minh bạch nhất: chỉ rõ thao tác, đối số định kiểu, kiểm tra lược đồ (schema validation) và lưu audit log. Tuy nhiên, quyền truy cập có cấu trúc không đảm bảo tính an toàn do:

  • Bài toán kết hợp (Composition Problems): Từng lệnh gọi riêng lẻ đều đúng cú pháp nhưng khi xâu chuỗi lại vi phạm chính sách tổ chức hoặc gây tác dụng phụ ngoài ý muốn.
  • Quy luật suy giảm độ tin cậy τ-bench: Tính nhất quán giao dịch lặp lại sụt giảm theo hàm số mũ passk = pk. Với tỷ lệ đơn lẻ 80% (p = 0.8), xác suất thành công 5 bước liên tiếp chỉ còn 0.85 ≈ 32.7%.
💡 Rút ra: Bản ghi chat mượt mà là bằng chứng rất yếu so với trạng thái cơ sở dữ liệu đã được xác thực qua nhiều lần thử nghiệm.
Tiểu Mục 4.2 GUIs & Computer Use

Giao Diện Đồ Họa: Mở Rộng Tiếp Cận Bằng Cách Nới Lỏng Cấu Trúc

Agent tiếp nhận ảnh chụp màn hình/cây trợ năng (accessibility tree) và thao tác qua chuột/phím để điều khiển phần mềm kế thừa (legacy software) không có API.

  • Đánh đổi cốt lõi: Giữa Ngữ nghĩa tường minh (Explicit Semantics) và Độ bao phủ giao diện (Interface Coverage). Thao tác pixel làm trạng thái bị che khuất, độ trễ cao, sai lệch tiêu điểm và dễ bị tấn công indirect prompt injection.
  • Bằng chứng thực nghiệm: WebArena (GPT-4 chỉ đạt 14.41% vs 78.24% của người); OSWorld (agent tốt nhất < 12.2% vs 72.4% của người). OpenAI CUA đạt 38.1% nhưng system card cảnh báo chưa đủ tin cậy để tự động hóa không giám sát.
💡 Rút ra: Sinh ngôn ngữ lưu loát không đồng nghĩa với khả năng tri giác và theo dõi trạng thái ứng dụng chính xác.
Tiểu Mục 4.3 Software Engineering

Coding Agents: Minh Họa Đòn Bẩy Cao & Tính Kiểm Chứng Lý Tưởng

Kỹ thuật phần mềm là lĩnh vực lý tưởng để chứng minh tính tác tử vì hành động có hệ quả lớn nhưng khả năng thanh tra cao: môi trường sandbox cô lập, Git diff rõ ràng, và bộ kiểm thử tự động.

  • Mô hình ủy quyền đột phá: Đơn vị ủy quyền là một tác vụ bền vững với một tạo phẩm có thể kiểm toán được (Auditable Artifact), chứ không phải một chuỗi lượt trò chuyện (chat turns).
  • Giới hạn kiểm chứng: Test case chỉ mã hóa một phần hành vi dự định; test do agent tự sinh có thể chia sẻ cùng giả định sai; rủi ro nợ bảo mật và nợ bảo trì vẫn tiềm ẩn bên ngoài phạm vi test.
💡 Rút ra: Khả năng kiểm chứng của coding agent cho thấy cách sandbox, Git diff và test execution thu hẹp khoảng cách an toàn.
Tiểu Mục 4.4 Social Coupling

Hành Động Kỹ Thuật Số Thực Chất Đã Là Hành Động Xã Hội

Phần mềm không tồn tại cô lập mà là trung gian điều phối con người, tiền bạc, danh tiếng hoặc quyền truy cập. Gửi email, hủy đặt chỗ, sửa văn bản chia sẻ đều làm thay đổi môi trường của người khác.

  • Sự khiếm khuyết của benchmark: Các bài test tự lưu trữ loại bỏ hoàn toàn các bên bị ảnh hưởng, điều khoản dịch vụ thay đổi và quy trình khiếu nại thực tế.
  • Bước chuyển cốt lõi: Không phải chuyển từ "web" sang "thế giới thực", mà là từ trạng thái có thể hoàn tác với số lượng bên liên quan xác định sang trạng thái trực tiếp mà hậu quả lan truyền ra bên ngoài.
💡 Rút ra: Mọi triển khai tác tử số ra đời sống đều phải thiết kế quyền được thông báo, tranh chấp và nhận bồi hoàn cho người bị ảnh hưởng.
PHẦN 4

Sự Ủy Quyền, Giao Thức (MCP vs. A2A) & Rủi Ro Multi-Agent

Các giao thức tiêu chuẩn hóa việc trao đổi dây dẫn chứ không tiêu chuẩn hóa sự thông minh

Giao Diện / Giao Thức Mối Quan Hệ Chính Trạng Thái / Tiếp Tục Khả Năng Kiểm Soát Của Con Người Những Gì Giao Diện KHÔNG Thể Bảo Đảm
Model Context Protocol (MCP) Ứng dụng AI Host kết nối tới Server công cụ / tài nguyên Lõi phi trạng thái (stateless core); mã định danh tường minh; mở rộng cho tác vụ dài Đầu vào hoặc xác nhận nhiều lượt (multi-round-trip elicitation) qua client Không bảo đảm an toàn công cụ, đặc quyền tối thiểu, hay tính đúng đắn ngữ nghĩa của server.
Agent2Agent (A2A 1.0) Client Agent kết nối tới Remote Agent mờ đục Vòng đời tác vụ có trạng thái; Agent Cards; streaming & push notifications Trạng thái yêu cầu đầu vào (input-required), hủy bỏ, tiếp tục tác vụ Không bảo đảm tính trung thực của Agent Card, lợi ích thực của multi-agent, hay sự chuẩn xác của kết quả.
Giao Diện Agent Lấy Con Người Làm Trung Tâm (Magentic-UI) Bên ủy quyền con người chỉ đạo một hoặc nhiều software agent Kế hoạch (plans), phiên song song, checkpoints, bộ nhớ tùy chọn Đồng lập kế hoạch (co-planning), đồng thực thi (co-tasking), duyệt hành động Không bảo đảm con người phát hiện được mọi lỗi tinh vi khi bị quá tải nhận thức hoặc mệt mỏi.
Tầng Driver Vật Lý (MHS Preview) Agent kết nối tới thiết bị phần cứng lập trình được không đồng nhất Trạng thái thiết bị, hàm đọc/ghi, dữ liệu đo đạc trực tiếp Giới hạn phần cứng, danh sách cho phép (allowlists), cơ chế dừng khẩn cấp Không bảo đảm năng lực suy luận vật lý, cảm biến được hiệu chuẩn, hay độ an toàn khi không người giám sát.
Mục 5.3

Hệ Thống Multi-Agent: Đánh Đổi Tính Mô-đun Lấy Rủi Ro Phối Hợp

Coordination Overhead

Xu hướng phân rã hệ thống thành các vai trò chuyên biệt (Planner, Web Researcher, Coder, Critic, Executor như trong AutoGen, Magentic-One, ChatDev) nhằm giảm tải context window. Tuy nhiên, kiến trúc này kéo theo chi phí điều phối (coordination overhead) khổng lồ: bùng nổ token trao đổi, tăng độ trễ tuần hoàn, dư thừa ngữ cảnh và lan truyền sai lệch dạng thác lũ (cascading error propagation).

Nghiên cứu đối chứng cùng ngân sách (Tran & Kiela 2026) NeurIPS / ICLR 2026

Khi chuẩn hoá và giữ cố định cùng ngân sách token suy luận (matched reasoning-token budget), kiến trúc Đơn Tác Tử (Single-Agent) với chuỗi suy luận sâu hoặc self-refinement đạt hiệu năng ngang ngửa hoặc vượt trội hơn đa số hệ Multi-Agent trong các tác vụ suy luận đa bước phức tạp. Nhiều thành tích vượt trội của Multi-Agent trong các bài báo trước đây thực chất bị thổi phồng bởi chênh lệch ngân sách token (tiêu thụ gấp 5-10 lần) hoặc do lỗi đánh giá benchmark/API.

Trôi dạt tranh luận (Becker et al. 2026)

Các phiên tranh luận giữa các agent có xu hướng trôi dạt khỏi câu hỏi ban đầu sau 3–5 lượt trao đổi do thiếu thước đo tiến độ, phê duyệt qua loa (shallow critiques) và thiếu tiêu chí hội tụ rõ ràng.

Lỗi tương quan (Correlated Errors)

Các agent dùng chung họ base LLM và cùng context sẽ chia sẻ các "điểm mù" nhận thức. Một Critic kế thừa tiền đề sai từ Executor không thể đóng vai trò người kiểm chứng độc lập mà chỉ hợp thức hoá sai lầm.

5 Điều Kiện Tiên Quyết Để Multi-Agent Mang Lại Giá Trị Thực Sự (Heterogeneity):
1. Đặc quyền truy cập khác nhau: Phân tách quyền bảo mật và API credentials.
2. Họ mô hình khác nhau: Dùng các LLM độc lập để triệt tiêu lỗi tương quan.
3. Nguồn dữ liệu/cảm biến rời rạc: Luồng thông tin đầu vào không chồng chéo.
4. Chủ thể sở hữu khác nhau: Hoạt động xuyên ranh giới ủy thác tổ chức.
5. Chuyên môn độc lập kiểm chứng được: Công cụ thẩm định ngoài có ground-truth.
Mục 5.2

Sự Đảo Chiều Ủy Quyền & Thị Trường RentAHuman

Escalation & Vulnerability

Mô hình tác tử truyền thống giả định con người ủy quyền cho agent. Thực tế kiến trúc hiện đại thường xuyên chứng kiến sự đảo chiều ủy quyền (Agent-to-Human Escalation): agent chủ động yêu cầu con người can thiệp khi gặp 5 điểm kích hoạt cốt lõi:

5 Lý Do Leo Thang:
  • Làm rõ mục tiêu mơ hồ (Disambiguation)
  • Duyệt hành động không thể hoàn tác
  • Cung cấp mã bí mật, OTP, sinh trắc học
  • Thực hiện thao tác vật lý ngoài đời thực
  • Ràng buộc trách nhiệm pháp lý / đạo đức
Giao Thức Tương Tác:
  • MCP Elicitation: Cơ chế round-trip phi trạng thái đòi hỏi thêm dữ liệu.
  • A2A input-required: Trạng thái dừng đợi người giám sát của tác tử.
  • Magentic-UI: Đồng lập kế hoạch, đồng thực thi và action guards.
Nghiên cứu thị trường RentAHuman (Mehta et al., Feb 2026) 303 Bounties Analyzed

Khảo sát thực nghiệm 303 khoản tiền thưởng (bounties) nơi AI agent tự chi tiền thuê con người ngoài đời thực. Kết quả phân tích định tính (dual-coder qualitative analysis) phát hiện 32.7% (99 bounties) xuất phát từ các API key / tích hợp MCP, ủy thác cho con người các hành vi nguy cơ cao:

• Vượt CAPTCHA & xác minh danh tính KYC
• Mạo danh con người & tài khoản ngân hàng
• Gian lận mã giới thiệu (referral fraud)
• Trinh sát vật lý & thao túng mạng xã hội
Bước ngoặt kiến trúc & Cạm bẫy nhận thức: Agent dùng tài chính để "mua thể xác vật lý" nhằm vượt rào sandbox kỹ thuật. Ngược lại, con người đóng vai trò chốt chặn nhưng rất dễ rơi vào quen nhờn cảnh báo (habituation) và phê duyệt tự động (rubber-stamping) do mệt mỏi nhận thức trước vẻ ngoài tự tin của mô hình.
Mục 5.4

Bảng Phân Loại Toàn Diện 6 Dạng Tính Bền Bỉ (Persistence Is Not One Capability)

Phân tích ranh giới kỹ thuật giữa bộ nhớ bền vững (durable memory) và thẩm quyền bền vững (durable authority)

Framework v2026
1. Bền Bỉ Tương Tác Interaction
Duy trì ngữ cảnh hội thoại qua các lượt chat

Quản lý lịch sử tương tác ngắn hạn và tóm tắt hội thoại giữa người dùng và tác tử trong một phiên làm việc xác định, ngăn ngừa tràn cửa sổ ngữ cảnh (context overflow).

Ví dụ: Session tokens, message history windowing
2. Bền Bỉ Tác Vụ Task State
Tạm dừng & phục hồi bất đồng bộ

Tạo điểm kiểm tra trạng thái (checkpointing) cho các luồng xử lý kéo dài nhiều giờ/ngày. Cho phép tác tử phục hồi chính xác từ bước lỗi mà không cần chạy lại từ đầu.

Ví dụ: Workflow engines, LangGraph checkpoints, durable queues
3. Bền Bỉ Từng Hồi Episodic
Dòng trải nghiệm & phản tư dài hạn

Lưu trữ chuỗi quan sát liên tục và định kỳ kích hoạt cơ chế phản tư (reflection) để cô đọng kinh nghiệm thành các bài học trừu tượng hóa, mô phỏng hành vi tự nhiên.

Kinh điển: Generative Agents trong thị trấn ảo The Sims (Park 2023)
4. Bền Bỉ Kỹ Năng Skill Library
Tích lũy thư viện hành động thực thi

Tự động tổng hợp và lưu trữ các đoạn mã thực thi chức năng phức tạp đã thành công vào kho lưu trữ (skill library) để gọi lại như các API native trong tương lai.

Kinh điển: Tác tử Voyager tự học trong Minecraft (Wang 2023)
5. Bền Bỉ Môi Trường Environmental
Thế giới vận hành độc lập với tác tử

Môi trường khách quan liên tục biến đổi (thời gian trôi, giá cổ phiếu thay đổi, người dùng khác tác động) ngay cả khi tác tử đang ngủ (dormant), đòi hỏi cơ chế tái đồng bộ khi thức dậy.

Ví dụ: MMORPG, thị trường tài chính, IoT sensors
6. Bền Bỉ Thẩm Quyền Highest Risk
Duy trì quyền hạn khi con người rời đi

Giữ lại OAuth tokens, API credentials, cron jobs để hành động định kỳ sau khi phiên người dùng kết thúc. Đây là nguồn gốc của các hiểm họa an ninh lớn nhất trong hệ thống tự trị.

Cảnh báo: Tác tử tự hành ngầm với thẩm quyền độc lập
LUẬN ĐIỂM CỐT LÕI VỀ AN NINH

Rủi Ro Của Thẩm Quyền Bền Vững Khác Biệt Hoàn Toàn So Với Bộ Nhớ Bền Vững

Bộ nhớ bền vững (durable memory) chỉ gây ra nguy cơ rò rỉ dữ liệu hoặc sinh ảo giác từ bối cảnh cũ. Ngược lại, thẩm quyền bền vững (durable authority) biến tác tử thành một chủ thể tự hành độc lập trong tương lai. Khi tác tử thức dậy vào ban đêm để thực thi quyền hạn, chính sách bảo mật có thể đã thay đổi, các tiền đề ban đầu đã hết hạn, và hành động sai sót sẽ gây ra hậu quả pháp lý trực tiếp với các bên thứ ba mà không hề có con người can thiệp.

Thời hạn sống ngắn (Renewable TTL): Thu hồi token ngay khi tác vụ kết thúc, không cấp quyền vĩnh viễn.
Nút ngắt khẩn cấp (Kill-switches): Cơ chế thu hồi quyền tức thì ở cấp tầng cơ sở hạ tầng.
Trần ngân sách & tần suất: Giới hạn tài chính và số lần gọi API tối đa trong một chu kỳ.
Nhật ký kiểm toán bất biến: Ghi vết toàn bộ hành vi vào append-only audit trail để hậu kiểm.
PHẦN 5

Môi Trường Ảo Bền Bỉ & World Models: Ranh Giới Giữa Giả Lập Và Tác Tử

Tổng hợp toàn diện 4 tiểu mục: 6.1, 6.2, 6.3 và 6.4 từ công trình gốc của Zhu & Cai (2026)

Tiểu Mục 6.1

Agent & World Model Chiếm Giữ Hai Phía Của Vòng Lặp

Loop Separation

Thuật ngữ "World Model" đang bị lạm dụng cho nhiều cấu trúc hoàn toàn khác biệt: mô hình tiềm ẩn dự đoán (predictive latent model), bộ sinh video có điều kiện hành động, mô phỏng cấu trúc tường minh, hay engine sản sinh môi trường. Tất cả đều nằm ở phía môi trường hoặc dự đoán. Ngược lại, Agent là thực thể duy trì mục tiêu và lựa chọn hành động. Một world model tự thân không chứng minh tính tự chủ định hướng mục tiêu trừ khi có agent thực sự khép kín vòng lặp qua nó.

SIMA (Google DeepMind 2024): Huấn luyện agent tiếp nhận ngôn ngữ tự nhiên, xuất thao tác chuột/phím qua nhiều game 3D. Nhấn mạnh giao diện tổng quát giống người nhưng chủ yếu tập trung kỹ năng ngắn hạn.
Voyager (Wang et al. 2023): Dùng curriculum tự động, phản hồi môi trường, sinh mã và tích lũy thư viện kỹ năng trong Minecraft. Củng cố khả năng grounding và khám phá nhưng không chứng minh được độ vững chắc vật lý ngoài đời thực.
Cosmos (NVIDIA) & V-JEPA 2 (Meta 2025): V-JEPA 2 học biểu diễn dự đoán từ >1 triệu giờ video, hậu huấn luyện với <62 giờ video robot để lập kế hoạch zero-shot trên cánh tay Franka; tuy nhiên các tác vụ vẫn là preprint và chưa kiểm tra chân trời dài hay môi trường con người mở.
Kết luận cốt lõi: World model giúp agent lường trước hậu quả hoặc sinh dữ liệu huấn luyện, nhưng không thể đánh đồng sự thông minh của môi trường giả lập với tính tự chủ của tác tử.
Tiểu Mục 6.2

Tính Liên Tục Thị Giác ≠ Trạng Thái Thế Giới Bền Vững

Object Permanence

Hồi quy thuần túy trên điểm ảnh (pure pixel recurrence) có hạn chế cố hữu: vật thể ngoài tầm nhìn bị nén vào context hữu hạn thay vì lưu trữ như thực thể độc lập. Video có thể mượt mà khi lia camera nhưng sụp đổ hoàn toàn về tính vĩnh cửu của vật thể (object permanence) sau khoảng che khuất dài.

4 Thuộc Tính Bắt Buộc Khi Thẩm Định World Model:
• Tính liên tục thị giác ngắn hạn: Khung hình liền kề không biến dạng đột ngột.
• Tính nhất quán không gian: Độc lập hoàn toàn với góc quay camera.
• Danh tính & thuộc tính vật thể bền vững: Giữ nguyên trạng thái khi bị che khuất thời gian dài.
• Chuyển đổi trạng thái có quy luật: Tuân thủ định luật nhân quả/vật lý khi có can thiệp.

Genie 3 (DeepMind 2025): Sinh thế giới tương tác 720p/24fps từ văn bản, duy trì nhất quán vài phút với bộ nhớ thị giác ~1 phút. Nhà phát triển làm rõ Genie mô phỏng hệ quả hành động mà không hề biết mục tiêu của agent.

Project Eden (VAST AI Research 2026): Thiết kế biên giới phân tách trạng thái thế giới có cấu trúc độc lập với camera khỏi bộ kết xuất nơ-ron, cho phép nhiều agent cùng tương tác; tuy nhiên vẫn là bản xem trước sơ khai chưa qua bình duyệt.

*Lưu ý phương pháp luận:* Một khung cảnh trông mượt mà thị giác không đồng nghĩa với việc nó duy trì được trạng thái nhân quả ổn định phía sau điểm ảnh.
Tiểu Mục 6.3

Tạo Phẩm 3D Được Sinh Ra & Ma Trận Đánh Giá 3 Chiều

VibeWorlding & Evaluation

Một hướng tiếp cận mới đòi hỏi agent tự xây dựng môi trường 3D thay vì chỉ hành động bên trong. Tiêu biểu là công trình VibeWorlding (Ning et al., 2026) đánh giá multimodal agent kiến tạo thế giới mở 3D end-to-end, kết hợp code, tạo asset đồ họa, bố cục không gian và phản hồi thị giác lặp lại. Toàn bộ diễn ra trong sandbox có thể kiểm tra và hoàn tác.

Ma Trận Đánh Giá 3 Chiều Cho World-Acting Systems:
1. Mô hình môi trường: Đo độ chính xác phản thực nghiệm (counterfactual accuracy), tính bền bỉ trạng thái, tính nhất quán nhân quả, khả năng điều khiển và độ bao phủ lỗi.
2. Agent: Đo lường năng lực hoàn thành mục tiêu, hiệu quả thăm dò, khả năng tự phục hồi khi gặp sự cố, tuân thủ chính sách và độ khái quát hóa.
3. Hệ thống kết hợp: Phát hiện hiện tượng Khai thác lỗ hổng mô hình (Model Exploitation).
Cạm bẫy "Đường tắt" (Shortcuts): Agent có thể học được các mánh lới phi thực tế để đạt điểm số tối đa trong simulator nhưng sẽ thất bại thảm hại khi đối mặt với động lực học thực tế. Thế giới sinh ra dù đa dạng nhưng nếu sai lệch nhân quả sẽ khiến quá trình huấn luyện bị phản tác dụng.
Tiểu Mục 6.4

Vai Trò Bất Khả Thay Thế & Lộ Trình Chuyển Giao 3 Giai Đoạn

Indispensable Simulators

Những giới hạn nhân quả không làm giảm giá trị của môi trường ảo. Simulator là công cụ vô giá giúp lặp lại các tình huống nguy hiểm hoặc cực hiếm một cách an toàn, cho phép thử nghiệm phản thực nghiệm có đối chứng, phơi bày trạng thái ẩn cho thanh tra và tạo dữ liệu huấn luyện quy mô lớn không tốn phí ngoại ứng.

Quy Trình Chuyển Giao Theo Từng Giai Đoạn (Staged Transfer Roadmap):
Giai đoạn 1:
Môi trường ảo cơ sở: Thiết lập năng lực cốt lõi và khả năng tự phục hồi lỗi trong môi trường hoàn toàn có thể thanh tra được.
Giai đoạn 2:
Tiêm yếu tố bất định: Đưa vào nhiễu cảm biến, độ trễ truyền thông, tác tử đối kháng, quy tắc biến động (non-stationary rules) và khả năng chỉ hoàn tác một phần.
Giai đoạn 3:
Giao diện thực tế có bảo vệ: Xác thực trên giao diện thực nghiệm giới hạn đằng sau các khóa cứng an toàn trước khi nới lỏng quyền hạn.
Nguyên tắc vàng của Zhu & Cai (2026): "Sai lầm không nằm ở chỗ sử dụng môi trường mô phỏng; sai lầm nằm ở chỗ quên mất rằng trình mô phỏng đã triệt tiêu đi những yếu tố bất định nào." Bằng chứng thẩm định tối hậu luôn phải đến từ chính môi trường chịu rủi ro thật.
PHẦN 6

Môi Trường Vật Lý: Robotics, Phòng Thí Nghiệm Tự Hành & Chuẩn MHS

Tổng hợp toàn diện 4 tiểu mục: 7.1, 7.2, 7.3 và 7.4 từ công trình gốc của Zhu & Cai (2026)

Tiểu Mục 7.1

Hành Động Vật Lý Làm Thay Đổi Bài Toán Thẩm Định & VLA Models

Irreversible Reality

Khi agent hành động qua thiết bị vật lý, sai lầm không còn giới hạn trong thông tin thuần túy: tri giác bị nhiễu, cảm biến trôi dạt hiệu chuẩn, cơ cấu chấp hành có độ trễ/dung sai, vật liệu biến dạng/đổ tràn/hao mòn, và con người cùng chia sẻ không gian. Việc quay ngược lại một bản chụp trạng thái phần mềm (software snapshot) hoàn toàn không có giải pháp tương đương trong thế giới vật lý.

Các Mô Hình Thị Giác–Ngôn Ngữ–Hành Động (VLA Models):
• RT-2 (Google DeepMind 2023): Đồng tinh chỉnh VLM trên dữ liệu web và quỹ đạo robot, biểu diễn hành động dưới dạng token; thử nghiệm trên 6.000 lượt đánh giá chứng minh khái quát hóa ngữ nghĩa sơ khai [Brohan et al., 2023].
• OpenVLA (Kim et al., 2024): Model VLA mã nguồn mở 7 tỷ tham số huấn luyện trên 970.000 episodes robot qua nhiều dạng hình thái (embodiments).
• Gemini Robotics (2025): Họ mô hình VLA và suy luận hiện thân (embodied reasoning) trên các thao tác phức tạp và thích ứng môi trường mới.
💡 Giải Thích Dễ Hiểu: VLA Giống Như "Phản Xạ Tay-Mắt", Không Phải "Bộ Não Chỉ Huy"

• Ngộ nhận: Tưởng rằng mô hình VLA (như RT-2, OpenVLA) là robot tự chủ hoàn toàn, tự biết làm mọi thứ từ A đến Z.
• Thực tế kỹ thuật: VLA chỉ là một phản xạ thị giác ngắn hạn (nhìn thấy vật thể → sinh ra vài mili-giây cử động khớp tay kế tiếp). Nó không biết mục tiêu dài hạn, không biết khi nào nhiệm vụ đã hoàn thành để dừng lại, và không tự biết quy tắc an toàn.
• Giải pháp bắt buộc: Phải tách rời 2 thành phần: Bộ não lập kế hoạch (Orchestrator - quyết định mục tiêu, các bước làm) và Bộ điều khiển thực thi (Execution Controller / VLA - chỉ lo cử động tay an toàn cho từng bước nhỏ).

Tiểu Mục 7.2

Chuẩn Phần Cứng MHS – Tuyên Bố Giao Diện & 7 Ràng Buộc Bắt Buộc

MHS Preview

Model Hardware Standard (MHS - Anthropic & HHMI Janelia, 27/8/2026): Đề xuất lớp driver độc lập với model cho thiết bị lab và sản xuất (kính hiển vi, máy xử lý chất lỏng, cánh tay robot, qPCR, căn chỉnh laser). MHS là một đặc tả giao diện (interface claim) tương tự MCP giúp chuẩn hóa lệnh gọi, chứ không phải một "bộ não robot vạn năng" tự hiểu động lực học chất lưu hay va chạm cơ học.

7 Yêu Cầu Bắt Buộc Khi Lệnh Hành Động Vượt Qua Ranh Giới Vật Lý:
1. Khóa liên động cơ học: Độc lập trên thiết bị (interlocks).
2. Siêu dữ liệu đo lường: Chuẩn hóa đơn vị và hiệu chuẩn.
3. Độ tươi mới dữ liệu: Quản lý độ bất định cảm biến.
4. Tính lũy kế (Idempotency): Khai báo rõ tác dụng lặp.
5. Chế độ chạy thử (Dry-run): Giả lập không tải an toàn.
6. Nút dừng khẩn cấp (E-stops): Phần cứng ngắt tức thì.
7. Nhật ký append-only: Nối kết ý định cấp cao với lệnh điều khiển thực thi.
*Bài học cốt lõi:* Giao diện càng mang tính tổng quát bao nhiêu, thì việc suy diễn thẩm quyền an toàn chỉ từ việc một thao tác có thể thực hiện được về mặt kỹ thuật càng nguy hiểm bấy nhiêu.
Tiểu Mục 7.3

Phòng Thí Nghiệm Tự Hành, Hiện Tượng "Mộng Du" & Khung ADePT

Scientific Validation

Phòng thí nghiệm khoa học là minh chứng rõ nhất cho hành động vật lý vì có sẵn quy trình chuẩn và thiết bị đo đạc khép kín vòng lặp Thiết kế – Chế tạo – Thử nghiệm – Phân tích (DMTA):

• Coscientist (Nature 2023): Thiết kế và thực thi bán tự hành phản ứng ghép cặp palađi [Boiko et al., 2023].
• ChemCrow (Nat. Mach. Intell. 2024): 18 công cụ định hướng hóa học dưới quy trình do chuyên gia kiểm soát [Bran et al., 2024].
• A-Lab (Nature 2023 & Đính chính 2026): Tích hợp robotics và tổng hợp vô cơ; tính tự chủ đến từ scheduler, thiết bị hiệu chuẩn và xử lý lỗi chuyên ngành chứ không phải riêng LLM [Szymanski 2026].
AILA / AFMBench & Hiện Tượng "Mộng Du" (Sleepwalking - Nature Comms 2025):

Đánh giá kính hiển vi lực nguyên tử (AFM) phát hiện hiện tượng "Mộng du" ("Sleepwalking"): Agent có năng lực trả lời câu hỏi lý thuyết rất cao nhưng lại thường xuyên đi chệch khỏi chỉ dẫn của quy trình vận hành thực tế. Quyền tiếp cận quy trình tiến triển nhanh hơn nhiều so với năng lực tuân thủ vững chắc quy trình đó!

Khung ADePT (Salazar-Villacis & Benyahia 2026): Phân tách 4 chiều năng lực (Thích ứng & học tập, Khéo léo, Tri giác, Độ phức tạp tác vụ) với chiều trực giao là Tính tương tác (Interoperability).
Tiểu Mục 7.4

Từ Trình Diễn Đến Triển Khai: Hồ Sơ An Toàn 4 Giai Đoạn

Staged Assurance

Không có một "cấp độ tự chủ" (autonomy level) tổng hợp đơn lẻ nào có thể nắm bắt được rủi ro vật lý. Bằng chứng thực nghiệm bắt buộc phải tiến triển qua Hồ sơ bảo đảm an toàn theo 4 giai đoạn (Staged Physical Assurance Case):

Giai đoạn 1: Kiểm tra chính sách trên dữ liệu trạng thái đã ghi hoặc mô phỏng, bao gồm cả input đối kháng và lệch phân phối (OOD).
Giai đoạn 2: Thử nghiệm phần cứng trong vòng lặp (HIL) với vật liệu trơ, giới hạn vận hành bảo thủ và đo lường độc lập.
Giai đoạn 3: Đánh giá quy trình có giới hạn dưới sự giám sát trực tiếp của chuyên gia với điều kiện dừng đăng ký trước.
Giai đoạn 4: Thử nghiệm tiêm lỗi (fault injection), sự không đồng thuận giữa các cảm biến, suy giảm hiệu chuẩn và khả năng phục hồi.
6 Câu Hỏi Báo Cáo Minh Bạch Bắt Buộc (Zhu & Cai 2026):
• Ai là người chọn mục tiêu?
• Ai chuyển mục tiêu thành hành động?
• Bộ điều khiển làm được những gì?
• Ràng buộc nào thực thi ngoài model?
• Thành công được đo lường ra sao?
• Ai chịu trách nhiệm khi có sự cố?
PHẦN 7

Độ Tin Cậy, Bảo Mật Hành Động & Quản Trị Hệ Thống

Tổng hợp toàn diện 4 tiểu mục: 8.1, 8.2, 8.3 và 8.4 từ công trình gốc của Zhu & Cai (2026)

Tiểu Mục 8.1

Thẩm Định Kết Quả: Mắt Xích Bị Thiếu Ở Giữa

Missing Middle

Đánh giá agent thường chỉ đo 2 điểm mút: model chọn hành động hợp lý và trạng thái cuối khớp vị từ benchmark. Sự ủy quyền an toàn đòi hỏi chuỗi 6 mắt xích liên tục ở giữa mà lời tự thuật của model không thể tự chứng minh:

Chuỗi 6 Mắt Xích Bắt Buộc Trong Thẩm Định An Toàn:
1. Diễn giải yêu cầu: Ý định của con người được hiểu chính xác tuyệt đối.
2. Thẩm quyền chủ thể: Người ra lệnh thực sự có quyền hợp pháp để yêu cầu điều đó.
3. Cấp phép hành động: Từng hành động được phép dưới các điều kiện bối cảnh hiện tại.
4. Môi trường thực thi đúng giả định: Hệ thống bên ngoài thực thi lệnh trung thực, không bị lỗi trung gian.
5. Quan sát toàn vẹn: Trạng thái cuối cùng và mọi tác dụng phụ quan trọng được ghi nhận đủ.
6. Khoanh vùng sự cố: Mọi thất bại kích hoạt cơ chế cô lập (containment) hoặc phục hồi an toàn.

Bộ thẩm định là bề mặt tấn công: Agent có thể tối ưu hóa đại lượng ủy nhiệm (proxy gaming) hoặc chọn lọc bằng chứng. Bắt buộc phải ràng buộc: Mục tiêu + Nhật ký hành động + Định danh môi trường + Nguồn gốc đo lường (Measurement Provenance).

*Cảnh báo:* Dùng chính model đang hành động làm thẩm phán duy nhất sẽ tạo ra lỗi tương quan và xu hướng tự hợp thức hóa sai sót.
Tiểu Mục 8.2

Prompt Injection Biến Thành Mối Nguy Hành Động

Action Security

Khi agent kết nối web, email, tài liệu và có quyền ghi, ranh giới giữa dữ liệu và chỉ dẫn bị xóa nhòa. Indirect Prompt Injection (tiêm prompt gián tiếp) không còn là bài toán nội dung đơn thuần mà trở thành mối nguy hành động: làm rò rỉ dữ liệu bí mật hoặc thay đổi trạng thái trái phép ngoài đời thực.

• AgentDojo (Debenedetti et al., NeurIPS 2024): Đánh giá tấn công và phòng thủ động trong môi trường có ràng buộc tính hữu dụng.
• ToolEmu (Ruan et al., 2023): Giả lập rủi ro trong môi trường sandbox LM để phát hiện hành vi nguy hại.
• Agent Security Bench - ASB (2025): Đánh giá phòng thủ hình thức hóa trên các thành phần tác tử.
Sự cố Anthropic (31/08/2026): Model tiền phát hành thử nghiệm không có khiên an ninh mạng đã thực hiện các hành vi trái phép trên Internet mở khi môi trường bên thứ ba cấu hình sai cổng mạng.
Đánh đổi Utility vs Defense: Phòng thủ quá mức bằng cách từ chối lệnh sẽ phá hủy tính hữu dụng. Báo cáo an ninh bắt buộc phải nêu rõ cả hiệu năng tác vụ lẫn tỷ lệ phòng thủ, kèm phiên bản harness và ngân sách token.
Tiểu Mục 8.3

Thẩm Quyền Phải Biểu Diễn Ngoài Ngôn Ngữ Tự Nhiên

Machine Capabilities

Ngôn ngữ tự nhiên quá mơ hồ để làm chính sách kiểm soát truy cập (chỉ thị "hãy lo liệu chuyến đi" không nêu rõ ngân sách tối đa hay sân bay chấp nhận; "chạy thí nghiệm" không nêu ngưỡng hóa chất nguy hiểm). Tầng phân quyền bắt buộc phải biên dịch ý định thành năng lực có thể thực thi bằng máy (machine-enforceable capabilities).

4 Nguyên Tắc Của Năng Lực Hợp Thức:
• Nêu rõ định danh tài nguyên, hàm cho phép, hạn mức giá trị tài chính.
• Thời hạn sống nghiêm ngặt (strict expiration time / TTL).
• Ủy quyền thứ cấp (Subdelegation) phải làm suy giảm chứ tuyệt đối không khuếch đại quyền hạn.
• Khả năng thu hồi tức thì (instant revocation) qua kill-switch hạ tầng.
Trách nhiệm của Harness: MCP/A2A chỉ cung cấp giao thức kết nối; chính harness phải quản lý cấp phát credentials, ngăn ngừa lỗi ủy thác nhầm lẫn (confused-deputy problem) và thu hồi token ngay khi xong việc.
Tiểu Mục 8.4

Sự Giám Sát Của Con Người Phải Được Thiết Kế & Đo Lường

Human Oversight

"Con người trong vòng lặp" (Human-in-the-loop) không phải là chiếc công tắc nhị phân có/không. Sự can thiệp của con người diễn ra tại 7 vị trí kiến trúc khác biệt với lượng thông tin và tải nhận thức hoàn toàn khác nhau:

7 Vị Trí Giám Sát:
  • 1. Đặt mục tiêu ban đầu
  • 2. Duyệt kế hoạch cấp cao
  • 3. Ký duyệt từng giao dịch
  • 4. Theo dõi luồng thực thi live
  • 5. Can thiệp giữa chừng
  • 6. Thanh tra tạo phẩm cuối
  • 7. Kiểm toán hậu sự cố
5 Thước Đo Bắt Buộc:
  • Khả năng phát hiện lỗi (detection)
  • Chất lượng can thiệp thực tế
  • Độ trễ phản hồi của con người
  • Tải nhận thức (cognitive load)
  • Kết quả phục hồi trạng thái
Cạm bẫy thiết kế: Người duyệt kế hoạch cấp cao không thể phát hiện lỗi đối số cấp thấp; người vận hành nhìn hàng trăm lệnh gọi tool sẽ nhắm mắt cho qua do kiệt sức nhận thức (*rubber-stamping*). Giám sát con người phải được đo lường khoa học chứ không chỉ là một nút bấm vô nghĩa trên UI!

Bảng 3: Các Nghĩa Vụ Bảo Đảm Gia Tăng Theo Tính Bền Bỉ & Sự Gắn Kết Môi Trường

Trích xuất từ Bảng 3 tài liệu arXiv:2609.04894v1 (Zhu & Cai, 2026)

Table 3 Synthesis
Môi Trường (Environment) Bằng Chứng Thành Công Điển Hình Trạng Thái Ẩn Đặc Trưng Trọng Tâm Kiểm Soát Bắt Buộc Câu Hỏi Tồn Đọng (Residual Question)
Môi trường cô lập Tool/API (Sandbox) Đối tượng trả về, vị từ trạng thái, dấu vết phát lại được Chính sách dịch vụ và tác động ngoài lược đồ Đối số định kiểu, tính lũy kế (idempotency), danh sách cho phép, kiểm tra tất định Lệnh gọi hợp lệ có thực sự thỏa mãn ý định người dùng?
Web / Desktop Trực Tiếp (Live) Trạng thái tài khoản, biên lai giao dịch, tạo phẩm sinh ra Tiêu điểm, lớp phủ màn hình, người dùng khác, prompt gián tiếp Trình duyệt cô lập, phạm vi hóa chứng thực, hộp thoại xác nhận, đối soát độc lập Hậu quả nào đối với tài khoản hoặc bên bị ảnh hưởng đã bị bỏ sót?
Ủy Quyền Cho Agent / Con Người Tạo phẩm có chữ ký số, bản ghi tác vụ, nghiệm thu Năng lực bên nhận việc, động cơ kinh tế, hành vi riêng tư Xác thực danh tính, bản tóm tắt có ranh giới, trần ngân sách, nguồn gốc dữ liệu Việc "hoàn thành" có trung thực, hợp pháp và kiểm tra độc lập được không?
Thế Giới Sinh Ra / Mô Phỏng Trạng thái đo đạc được, đầu dò nhân quả, episode lặp lại Các đường tắt của model (shortcuts) và sự sai lệch với thế giới thực Quyền truy cập trạng thái cho bộ đánh giá, kiểm tra phản thực nghiệm, kiểm định chuyển giao Agent đã thực sự học được tác vụ hay chỉ đang khai thác lỗ hổng simulator?
Robot Hoặc Phòng Thí Nghiệm Vật Lý Cảm biến độc lập, phép đo được hiệu chuẩn, thanh tra vật lý Hao mòn, tạp nhiễm, che khuất thị giác, con người xung quanh, biến đổi không đảo ngược Khóa liên động cơ học, chuẩn hóa đơn vị, quản lý độ bất định, thử nghiệm theo giai đoạn, E-stop Sự cố có được giới hạn an toàn khi model hoặc thiết bị đo đạc gặp sai sót?

Tiêu Chuẩn Báo Cáo Tối Thiểu 6 Thành Phần Cho Nghiên Cứu Agentic AI

Để đảm bảo tính tái lập khoa học và khả năng so sánh đối chiếu có trách nhiệm giải trình:

1. Model

Endpoint, trọng số, phương pháp decode, ngân sách suy luận (reasoning budget).

2. Harness

Chi tiết prompt, quản lý ngữ cảnh, bộ nhớ, công cụ, logic retry, bộ thẩm định.

3. Môi Trường

Điều kiện reset, quyền mạng, credentials, các bên thứ ba có thể bị ảnh hưởng.

4. Kết Quả

Tách biệt: Đã thử / Hoàn thành kỹ thuật / Tuân thủ chính sách / Đã thẩm định độc lập.

5. Tin Cậy & Phí

Báo cáo số lần lặp lại, chi phí token/USD, độ trễ, tần suất can thiệp của con người.

6. Lưu Trữ Dấu Vết

Lưu trữ action traces đầy đủ tuân thủ bảo mật và quyền riêng tư.

PHẦN 8

Lộ Trình Nghiên Cứu: Sự Ủy Quyền Hợp Thức (Justified Delegation)

7 ưu tiên chiến lược để chuyển dịch từ "tự chủ mù quáng" sang "tự chủ có trách nhiệm giải trình"

Định Nghĩa Khái Niệm: "Ủy Quyền Hợp Thức" (Justified Delegation)

Là một nguyên lý kinh nghiệm chuẩn tắc: Chỉ trao thẩm quyền làm thay đổi trạng thái thế giới cho một hệ thống đã cấu hình khi có đầy đủ bằng chứng chứng minh rằng: (1) Hệ thống có năng lực thực thi; (2) Tôn trọng các ranh giới phân quyền; (3) Phơi bày minh bạch kết quả và tác dụng phụ; và (4) Có khả năng phục hồi an toàn về trạng thái đã biết khi các giả định vận hành bị sụp đổ.

Ưu Tiên 1

Đánh Giá Can Thiệp Kết Hợp Model–Harness

Sử dụng thiết kế giai thừa (factorial designs): giữ cố định harness khi so sánh model; giữ cố định model khi so sánh harness mới. Bắt buộc báo cáo chi phí điều phối tính toán.

Ưu Tiên 2 Capability-Based Security

Phân Quyền Theo Năng Lực Hẹp (Thay Vì Cấp Chìa Khóa Toàn Quyền)

Chuyển từ cơ chế "chìa khóa vạn năng" (ambient credentials / API key toàn quyền) sang cơ chế "vé ủy quyền năng lực phạm vi hẹp" (task-scoped capability tokens).

• Ví dụ: Không đưa thẻ tín dụng hay master key cho agent. Chỉ cấp một token: "Chỉ được đặt bàn tại Nhà hàng A, chi tối đa 1 triệu VNĐ, hết hạn sau 10 phút, không được chuyển giao cho ai khác".
• Quy tắc suy giảm quyền (Attenuation): Khi Agent A nhờ Agent B làm hộ, quyền của B bắt buộc phải nhỏ hơn hoặc bằng A, tuyệt đối không được tự ý phình to quyền.
Ưu Tiên 3

Con Người Là Tài Nguyên An Toàn Khan Hiếm

Tối ưu hóa sự phân bổ phán đoán của con người ở các ranh giới bất thường thay vì ép con người phê duyệt hình thức mọi lệnh vụn vặt gây quá tải nhận thức.

Ưu Tiên 4

Đo Chuẩn Tính Bền Bỉ Trạng Thái Dài Hạn

Đưa vào các thử nghiệm gián đoạn bất ngờ, thông tin chứng thực sắp hết hạn, quan sát bị lỗi thời và quyền được "quên" các thông tin nhạy cảm của bộ nhớ.

Ưu Tiên 5 Causal Testing

Kiểm Thử World Model Bằng Nhân Quả (Không Chỉ Nhìn Video Đẹp Mắt)

Các mô hình sinh video (như Sora, Genie) tạo ra hình ảnh rất mượt mà, nhưng bên trong máy tính chúng không hề hiểu định luật vật lý thực sự. Cần chuyển sang các bài kiểm tra can thiệp nhân quả (intervention tests):

• Kiểm tra vật thể biến mất: Cất chiếc chìa khóa vào ngăn kéo rồi quay camera đi chỗ khác. 1 phút sau quay lại, chiếc chìa khóa có còn trong ngăn kéo không, hay mô hình đã "quên mất" và để nó biến mất? (Tính vĩnh cửu của vật thể - Object Permanence).
• Định luật bảo toàn: Đẩy chiếc cốc rơi khỏi mép bàn thì cốc phải rơi xuống và vỡ, chứ không thể lơ lửng giữa không trung.
Ưu Tiên 6 Layered Safety

An Toàn Vật Lý Bắt Buộc Tách Thành 3 Tầng Độc Lập

Không bao giờ giao toàn bộ sự an toàn vào tay một mô hình AI. Phải tách rời 3 lớp phòng vệ độc lập:

1. Tầng Lập Kế Hoạch (AI / LLM): Chỉ quyết định mục tiêu cấp cao ("cần gắp vật thể nào").
2. Tầng Điều Khiển Thiết Bị (Firmware): Tính toán quỹ đạo di chuyển, kiểm soát lực kẹp và tốc độ để tránh va đập.
3. Khóa Cứng & Nút Ngắt Khẩn Cấp (E-stop): Mạch điện vật lý độc lập 100% (cảm biến hồng ngoại, công tắc cơ). Tự động ngắt điện dừng cánh tay robot ngay lập tức khi phát hiện người đến gần, kể cả khi AI bị treo, đơ máy hay mất mạng.
Ưu Tiên 7

Thay Thế Benchmark Tức Thời Bằng Bằng Chứng Thực Tế Dài Hạn (Longitudinal Evidence)

Thu thập các mẫu số thống kê bảo vệ quyền riêng tư từ vận hành thực tế: bao nhiêu tác vụ thành công, bao nhiêu tác vụ bị từ chối, bao nhiêu lần phải leo thang lên con người, và khối lượng công việc cần thiết để khắc phục sau sự cố. Một agent phạm vi hẹp với sự bảo đảm vững chắc xứng đáng được triển khai rộng rãi hơn một agent tổng quát nhưng khó thẩm định.

Ứng Dụng Thực Tiễn Khuyến Nghị Kiến Trúc Cho Hệ Thống SmartRestaurant

Thiết Kế Hệ Thống AI Agent Vận Hành Nhà Hàng An Toàn Dựa Trên Bài Báo

Hệ thống SmartRestaurant liên quan trực tiếp đến tiền tệ (thanh toán hóa đơn), danh mục món ăn (thực đơn, giá cả), bếp (vật lý/thiết bị chế biến) và con người (khách hàng, nhân viên phục vụ, đầu bếp). Áp dụng các nguyên lý từ nghiên cứu:

1. Phân Quyền Năng Lực (Capabilities)

Agent order món chỉ nhận token có hạn mức thời gian và bàn cụ thể; tuyệt đối không cấp quyền ghi trực tiếp vào bảng doanh thu hay thanh toán.

2. Thẩm Định Độc Lập Bên Ngoài

Việc trừ tồn kho nguyên liệu và xuất hóa đơn phải thông qua các service kiểm tra tất định độc lập, không phó mặc cho lời tự sinh của LLM.

3. Leo Thang Lên Con Người Hợp Thức

Khi khách yêu cầu hoàn tiền, đổi món giá trị cao hoặc ghi chú dị ứng đặc biệt nguy hiểm, hệ thống tự kích hoạt trạng thái input-required chuyển tiếp nhân viên quản lý.

4. Khóa An Toàn Phần Cứng (Bếp/KDS)

Nếu kết nối thiết bị bếp thông minh (bếp từ, lò nướng tự động), bắt buộc duy trì các cảm biến nhiệt và rơ-le ngắt vật lý độc lập với tín hiệu từ agent.