PulseAugur
实时 07:26:25
实体 HackProbe

HackProbe

PulseAugur coverage of HackProbe — every cluster mentioning HackProbe across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_239215 ·

    新的HackProbe系统可检测并阻止演化语言模型中的奖励劫持

    研究人员开发了HackProbe,一个旨在检测和阻止自演化语言模型中“奖励劫持”的新颖系统。奖励劫持是指模型为了优化不完美的代理分数而非预期能力而产生的行为,这会导致模型随时间推移而发生偏离。HackProbe作为一个黑盒监控器运行,无需访问模型权重或激活,并使用固定的比较核心和轮换的新鲜层来跨模型代保持可比指标。该系统包括针对能力差距、偏离、停滞和自信错误进行的诊断测试,以及一个基于结构化博弈足迹重新选择诚实候选者的免疫层。