L4 / Model Service Layer

模型服务与编排层

把模型能力包装成可调用服务,处理路由、缓存、工具调用、上下文管理和成本控制。

Core Question

如何把模型能力变成可靠、可控、可计费的服务?

把模型能力包装成可调用服务,处理路由、缓存、工具调用、上下文管理和成本控制。

AT-E-004 · high
解决什么 / Capabilities
  • 模型路由
  • 上下文编排
  • 工具调用
  • 缓存
  • 限流与计费
典型技术 / Technologies
  • LLM Gateway
  • RAG
  • function calling
  • agent runtime
  • prompt orchestration
  • vector database
典型岗位 / Roles
  • AI application engineer
  • platform engineer
  • prompt engineer
  • agent engineer
常见失败模式
  • 幻觉放大
  • 上下文污染
  • 工具误调用
  • 成本失控
  • 服务降级不可见
Guardrails
  • 调用日志
  • 成本预算
  • 工具权限
  • 响应校验
  • fallback 策略
可被 AI 自动化的部分
  • 单轮问答集成
  • 通用 prompt 模板
  • 简单 RAG 管道
仍需人类负责的部分
  • 多模型路由策略
  • 工具权限建模
  • 复杂业务上下文管理
  • 生产可观测性
Role Responsibility角色
AI 基础设施工程师infrastructure-critical

负责算力、推理运行时、服务化、性能和成本边界。

Cognitive Transitions全部
T5 · 旧理解 c

团队用 RAG 解决模型幻觉。

认知操作 r@Dbound@ai_application_layer
新理解 C' · high

RAG 可以增强信息 grounding,但不能单独保证逻辑正确、合规正确或数值正确;高风险场景仍需验证层和 human gate。

T6 · 旧理解 c

Agent 被授权连续调用工具完成任务。

认知操作 r@Drisk_check@ai_application_layer
新理解 C' · high

Agent 的风险不只来自单次回答错误,还来自连续错误动作、工具误用、权限越界和不可追踪执行链。