rubric
PulseAugur coverage of rubric — every cluster mentioning rubric across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Figma 招聘 AI Models 设计负责人,招募设计推断岗位
Figma 聘请了 Elou,他将领导 AI Models 团队的设计工作。该团队正在积极招聘专注于 evals、judge 和 rubric 开发的岗位,以使 AI 模型能够推断设计元素。此次招聘活动凸显了该团队在构建设计生成和评估模型方面的重点。
-
新框架RubSE增强了UI到代码生成的稳定性
研究人员开发了RubSE框架,旨在通过使用图则作为结构化上下文进行自演进,来提高UI到代码生成的稳定性。该方法解决了“视觉修复耦合”问题,即代码编辑可能会无意中破坏用户界面的其他部分。RubSE通过生成和选择有针对性的图则来指导迭代优化过程,这有助于防止过于宽泛的更改并改善视觉回归的恢复能力。评估表明,RubSE在多个基准测试和视觉语言模型上的表现显著优于标准的自演进方法。
-
聊天机器人的LLM API成本:质量门槛优于令牌速率
在为客户支持聊天机器人选择LLM API时,最具成本效益的选择取决于每条可接受答案或目录更新的最低成本,而不仅仅是宣传的令牌速率。这需要一个严格的测试过程,所有候选LLM处理相同的一组代表性数据,并根据预定义的质量门槛和模式要求验证其输出。最终决定应考虑成本、延迟、重试率以及生成结构化、可验证输出的能力,确保所选模型真正满足应用程序的特定需求和安全标准。
-
新的AI训练方法使用评分标准作为开放式生成任务的特权信息
研究人员开发了一种名为On-policy self-distillation (OPSD)的新方法,该方法利用评分标准作为开放式文本生成的特权信息(PI)。该方法通过使用评分标准来指导偏好,从而增强了模型的训练信号,这比使用评分标准作为标量奖励的传统强化学习方法更有效。当应用于Qwen和Llama等模型家族时,该技术在HealthBench和ResearchQA等基准测试中表现出优越的性能,优于参考完成蒸馏和评分标准作为奖励的强化学习。
-
新的RUBRIC框架通过优化合成样本质量来改进不平衡分类
研究人员开发了RUBRIC,一个旨在提高不平衡数据集分类准确性的新框架,例如欺诈检测和医学诊断。该方法侧重于优化用于重新平衡类别分布的合成样本的质量,而不是简单地增加其数量。RUBRIC根据现实性(由学习到的判别器评估)和效用(通过与决策边界的接近度衡量)之间的平衡来对这些合成样本进行排名。在各种基准测试上的实验表明,RUBRIC在保持具有竞争力的ROC-AUC的同时,提高了F1-macro和召回率分数。