GPU
大规模矩阵计算的主要硬件载体。
算力与硬件层CUDAGPU 编程与算子优化生态。
算力与硬件层 / 框架内核与推理运行层分布式集群多节点训练和推理资源池。
算力与硬件层KV Cache推理时复用注意力键值缓存以降低延迟。
框架内核与推理运行层 / 模型服务与编排层量化用更低精度表示模型权重或激活以降低成本。
框架内核与推理运行层Transformer现代大模型的核心架构族。
模型训练与表示层RLHF / DPO偏好学习和模型行为塑形方法。
模型训练与表示层Embedding把对象映射到向量空间以支持检索和相似度计算。
模型训练与表示层 / 模型服务与编排层RAG通过检索外部知识增强生成。
模型服务与编排层 / 信任、安全与治理层工具调用让模型调用外部函数、数据库或服务。
模型服务与编排层 / 应用与产品层Agent Runtime管理多步计划、工具调用和状态的运行环境。
模型服务与编排层Workflow UI面向任务流的交互界面。
应用与产品层