实体
R. Giskard Reventlov
R. Giskard Reventlov
PulseAugur coverage of R. Giskard Reventlov — every cluster mentioning R. Giskard Reventlov across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
LLM的变异测试:在无真实标签的情况下识别提取错误
一种评估大型语言模型(LLM)数据提取能力的新方法采用了变异测试,该方法无需真实标签数据即可识别错误。此方法涉及对输入进行微小更改(例如,重新排序行、添加无关文本),并检查LLM的输出是否保持一致。虽然该技术已经成熟,并且存在METAL和LLMorph等工具,但最近一项针对535张扫描收据的实验旨在确定当这些变异测试标记出差异时,实际的错误率是多少。该研究试图量化被标记的输出在多大程度上是真正不正确的,这对于高效的人工审查LLM生成的…
-
合成LLM评估数据可能具有误导性,dev.to警告
使用合成数据评估LLM可能是一个陷阱,因为生成的数据集可能无法准确反映真实世界的流量。虽然工具可以轻松创建数千个测试用例,但关键挑战在于确保这些合成输入与用户交互的实际分布相匹配,包括罕见和复杂的情况。没有这种验证,合成数据的高通过率可能会产生误导,掩盖潜在的生产问题。
-
Giskard 协议通过鲁棒聚合增强去中心化学习 · 跟踪 2 个来源
研究人员开发了 Giskard,一种旨在提高大规模去中心化学习的安全性与效率的新协议。Giskard 解决了同时维护数据机密性并防御拜占庭(恶意或故障)参与者所带来的挑战。该协议将参与者组织成一个委员会树,与需要全员通信或给少数节点带来沉重负担的现有方法相比,实现了更具可扩展性的聚合方法。对多达一百万参与者的实验表明,即使有相当比例的拜占庭方,Giskard 也能在保持模型效用的同时降低通信复杂度。