CONCEPT / technology

RLHF / DPO

偏好学习和模型行为塑形方法。

Boundary

偏好数据决定行为边界。

模型训练与表示层
Why it matters

该概念用于定位 AI 技术栈中的能力、风险和责任边界。它不是孤立术语,而是和层级、失败模式、防护机制、证据一起进入 OCG 判断结构。

Related Transitions全部
T2传统算法在 AI 时代的迁移reinterpret@model_training_layer
T4Python 与 C++ 在 AI 中的分工decompose@kernel_runtime_layer