L1 / Compute Layer

算力与硬件层

AI 的物理地基,负责提供训练和推理所需的计算资源、带宽、显存和能源边界。

Core Question

模型能不能训得动、跑得快、成本压得下来?

AI 的物理地基,负责提供训练和推理所需的计算资源、带宽、显存和能源边界。

AT-E-001 · high
解决什么 / Capabilities
  • 训练算力
  • 推理吞吐
  • 显存容量
  • 高速互联
  • 数据中心供给
典型技术 / Technologies
  • GPU
  • NPU
  • TPU
  • CUDA
  • Tensor Core
  • 分布式集群
  • 芯片制造
典型岗位 / Roles
  • GPU kernel engineer
  • CUDA engineer
  • performance engineer
  • distributed systems engineer
常见失败模式
  • 显存不足
  • 通信瓶颈
  • 成本过高
  • 推理延迟过高
  • 硬件供应受限
Guardrails
  • 容量规划
  • 成本监控
  • 硬件冗余
  • 性能基准
可被 AI 自动化的部分
  • 常规资源申请
  • 基础监控脚本
  • 标准部署模板
仍需人类负责的部分
  • 底层性能优化
  • 硬件约束判断
  • 成本-性能权衡
  • 集群故障定位
Role Responsibility角色
AI 基础设施工程师infrastructure-critical

负责算力、推理运行时、服务化、性能和成本边界。

Cognitive Transitions全部
T4 · 旧理解 c

用户用 Python 写神经网络训练代码。

认知操作 r@Ddecompose@kernel_runtime_layer
新理解 C' · high

Python 主要承担上层接口、实验编排和生态调用;真正高密度数值计算通常由底层 C++ / CUDA runtime 执行。