L7 / Trust & Governance Layer

信任、安全与治理层

为 AI 输出建立证据、审计、合规、安全与风险控制,使系统可解释、可追责、可治理。

Core Question

系统凭什么被信任,错误发生时如何定位和追责?

为 AI 输出建立证据、审计、合规、安全与风险控制,使系统可解释、可追责、可治理。

AT-E-007 · high
解决什么 / Capabilities
  • 审计追踪
  • 安全防护
  • 合规控制
  • 证据账本
  • 风险评估
典型技术 / Technologies
  • evaluation
  • red teaming
  • policy engine
  • evidence ledger
  • access control
  • monitoring
典型岗位 / Roles
  • AI safety engineer
  • governance lead
  • security engineer
  • compliance officer
常见失败模式
  • 无法审计
  • 提示注入
  • 权限泄漏
  • 证据缺失
  • 合规风险
Guardrails
  • 证据账本
  • 红队测试
  • 权限最小化
  • 监控告警
  • 审批流
可被 AI 自动化的部分
  • 基础内容过滤
  • 通用安全清单
  • 标准日志记录
仍需人类负责的部分
  • 风险建模
  • 合规解释
  • 审计证据设计
  • 治理责任分配
Role Responsibility角色
AI 治理工程师human-critical

设计证据、规则、审计、策略和责任边界。

符号推理工程师partially-automatable

把规则、约束、验证逻辑和业务 DSL 转成可执行系统。

Cognitive Transitions全部
T2 · 旧理解 c

大模型把大量任务统一成 next-token prediction 和概率建模。

认知操作 r@Dreinterpret@model_training_layer
新理解 C' · medium-high

传统手工算法设计没有消失,而是从大众应用岗位迁移到底层训练优化、推理基础设施和上层符号约束系统。

T5 · 旧理解 c

团队用 RAG 解决模型幻觉。

认知操作 r@Dbound@ai_application_layer
新理解 C' · high

RAG 可以增强信息 grounding,但不能单独保证逻辑正确、合规正确或数值正确;高风险场景仍需验证层和 human gate。

T6 · 旧理解 c

Agent 被授权连续调用工具完成任务。

认知操作 r@Drisk_check@ai_application_layer
新理解 C' · high

Agent 的风险不只来自单次回答错误,还来自连续错误动作、工具误用、权限越界和不可追踪执行链。

T7 · 旧理解 c

LLM 输出一个看似合理的业务判断,但该判断可能违反公司规则。

认知操作 r@Dvalidate@trust_verification_layer
新理解 C' · high

LLM 输出应作为候选结果进入规则引擎或 DSL 校验层,由符号系统验证其是否符合业务约束。

T8 · 旧理解 c

模型输出法律、金融、安全或合规相关结论。

认知操作 r@Drequire@cognitive_governance_layer
新理解 C' · high

模型不得作为唯一最终责任主体,必须设置 human gate 或可审计的规则系统。