
点击查看大图

点击查看大图

点击查看大图

点击查看大图
全面介绍
💡 metrics.help:深度学习培训指标,一站式解析!
👋 欢迎来到 metrics.help!我们致力于帮您轻松理解和掌握机器学习中的各种指标和算法。无论您是初学者还是资深开发者,这里都能找到清晰易懂的资源,助您在深度学习之旅中乘风破浪!
✨ 为什么选择 metrics.help?
- 清晰易懂的定义和解释: 我们用最简洁的语言,为您剖析每一个关键指标的含义。
- 健康与不健康进展的可视化洞察: 不再只看数字,我们告诉您指标背后隐藏的训练状态。
- 深入探索强化学习算法: 特别针对强化学习中的复杂指标,提供清晰的解读。
🎯 我们能帮您理解哪些核心指标?
以下是我们提供详细解释的部分指标,让您对模型表现一目了然:
-
Accuracy(准确率): 预测正确的百分比。
✅ 关键信号:应随时间增加;过高训练准确率但验证集低可能过拟合。
-
Clipped Ratio(截断比): 被截断的生成文本比例。
⚠️ 关键信号:过高表示 max_length 过短或模型难以停止。
-
Completions(完成度): 生成文本的平均长度。
📏 关键信号:应与任务预期长度一致;异常骤降或骤升需警惕。
-
Entropy(熵): 策略随机性,探索与利用的平衡。
📉 关键信号:应缓慢下降;下降过快可能过早收敛,过高则未学到策略。
-
Epoch(周期): 遍历整个训练数据集的次数。
🔄 关键信号:应线性增加,用于跟踪训练进度。
- F1 Score(F1分数): 精确率和召回率的调和平均值。
-
Gradient Norm(梯度范数): 模型更新的幅度。
📈 关键信号:应保持稳定;骤增或骤降表示不稳定。
-
KL Divergence(KL散度): 当前策略与参考模型的偏差。
↔️ 关键信号:应在合理范围;过高表示策略变化过快。
-
Learning Rate(学习率): 训练步长,控制模型权重更新幅度。
🚀 关键信号:通常遵循预定计划(预热后衰减)。
-
Loss(损失): 模型预测与真实目标的差异。
-
Loss (DPO): Bradley-Terry 偏好排序损失。
💖 关键信号:必须低于 0.693 才能表现学习;极低值可能过拟合。
-
Loss (KTO): Kahneman-Tversky 优化损失。
📉 关键信号:应持续下降。
-
Loss (ORPO): SFT 与赔率比损失的结合。
🌟 关键信号:应随时间下降。
-
Loss (PPO): 截断代理策略损失。
⚠️ 关键信号:不一定像 SFT 损失那样递减,关注无巨大峰值。
-
Loss (Standard): 预训练和微调的交叉熵损失。
📉 关键信号:应随时间下降;验证损失发散表明过拟合。
-
Loss (DPO): Bradley-Terry 偏好排序损失。
-
Perplexity(困惑度): 模型混乱程度的衡量。
🤔 关键信号:越低越好,应与损失一同下降。
-
Precision(精确率): 正向预测的质量。
🔍 关键信号:假阳性代价高时尤其重要。
-
Recall(召回率): 发现正向样本的数量。
📊 关键信号:假阴性代价高时尤其重要。
- Reward Std(奖励标准差): 奖励的稳定性。
-
Rewards(奖励): 强化学习中反馈信号的强度。
-
Rewards (KTO): KTO 损失中隐含的奖励。
⬆️ 关键信号:应随时间增加。
-
Rewards (Standard): RL 训练的标准奖励信号。
📈 关键信号:应呈上升趋势,但伴有噪声和平台期。
-
Rewards (KTO): KTO 损失中隐含的奖励。
-
Train FLOPs(训练浮点运算): 训练期间执行的计算成本。
💻 关键信号:对大型语言模型预期值很高;应与训练步数大致线性增加。
我们相信,清晰的指标理解是优化模型、提升性能的关键。快来 metrics.help 探索,让您的深度学习项目事半功倍吧!
产品评分
暂无评分
登录后即可评分
















