L2 / Kernel & Runtime Layer

框架内核与推理运行层

负责让模型高效运行的底层软件层,包括框架后端、推理引擎、缓存、量化和调度。

Core Question

模型如何更快、更省、更稳定地运行?

负责让模型高效运行的底层软件层,包括框架后端、推理引擎、缓存、量化和调度。

AT-E-002 · high
解决什么 / Capabilities
  • 推理加速
  • KV Cache 管理
  • batch 调度
  • 量化
  • 运行时适配
典型技术 / Technologies
  • PyTorch backend
  • ATen
  • cuDNN
  • TensorRT
  • ONNX Runtime
  • vLLM
  • llama.cpp
  • SGLang
典型岗位 / Roles
  • inference engineer
  • runtime engineer
  • compiler engineer
  • model serving infrastructure engineer
常见失败模式
  • 显存碎片
  • KV Cache 管理失败
  • batch 调度不当
  • 量化精度下降
  • 硬件适配不足
Guardrails
  • 延迟基准
  • 吞吐压测
  • 精度回归测试
  • 运行时观测
可被 AI 自动化的部分
  • 常规框架调用
  • 默认 serving 参数
  • 通用量化配置
仍需人类负责的部分
  • 运行时瓶颈定位
  • 多卡调度
  • 高并发推理优化
  • 精度-成本权衡
Role Responsibility角色
AI 基础设施工程师infrastructure-critical

负责算力、推理运行时、服务化、性能和成本边界。

Cognitive Transitions全部
T2 · 旧理解 c

大模型把大量任务统一成 next-token prediction 和概率建模。

认知操作 r@Dreinterpret@model_training_layer
新理解 C' · medium-high

传统手工算法设计没有消失,而是从大众应用岗位迁移到底层训练优化、推理基础设施和上层符号约束系统。

T4 · 旧理解 c

用户用 Python 写神经网络训练代码。

认知操作 r@Ddecompose@kernel_runtime_layer
新理解 C' · high

Python 主要承担上层接口、实验编排和生态调用;真正高密度数值计算通常由底层 C++ / CUDA runtime 执行。