PulseAugur
实时 06:34:24
实体 model calibration

model calibration

PulseAugur coverage of model calibration — every cluster mentioning model calibration across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. COMMENTARY · CL_176840 ·

    开发者发现,不考虑角色背景的编码代理指标具有误导性

    一位运行着一组编码代理的开发者发现,如果不考虑模型的角色,比较模型性能指标会导致误导性的结论。分配给交互式主线程的模型与充当短暂子代理的模型相比,表现出截然不同的性能指标,角色对指标的影响高达 135 倍。跨模型角色构成的这种差异是由委托策略驱动的,这意味着汇总的性能数据可能不准确地暗示在特定操作层内不存在的巨大性能差距。

  2. TOOL · CL_125169 ·

    新的风险对齐框架改进深度学习模型校准

    研究人员开发了一个名为风险对齐(RA)的新框架,以改进深度学习模型的校准,这对于高风险应用至关重要。RA解决了为核密度估计(KDE)选择最优核带宽的挑战,KDE是一种用于量化模型失校准的方法。与最大似然估计(MLE)等传统方法不同,RA将重构风险与经验风险对齐,以最小化校准偏差。实验表明,RA在各种模型架构和数据集上提供更可靠的校准评估方面,始终优于现有方法。

  3. TOOL · CL_103222 ·

    Sakana AI 的 Fugu-Ultra 智能体自主优化机器学习训练和文本重建

    Sakana AI 开发了 Fugu-Ultra,这是一种能够自主改进机器学习训练配方的 AI 智能体。在一项实验中,Fugu-Ultra 在一台 H100 GPU 上迭代编辑了训练代码,并在 14 小时内运行了 123 次实验,取得了比三个前沿模型更好的平均每比特字节 (BPB) 分数。在另一项独立测试中,Fugu-Ultra 在重建古典日语文本的阅读顺序方面表现出卓越的性能,其 NED 分数达到 0.80,而其他模型的得分均低于 …