Themis
PulseAugur coverage of Themis — every cluster mentioning Themis across labs, papers, and developer communities, ranked by signal.
- 2026-06-23 research_milestone Researchers published a paper introducing Themis, an explainable AI-enabled framework for Reinforcement Learning with Human Feedback. 来源
2 天有情绪数据
-
爱沙尼亚指责俄罗斯纵火袭击向乌克兰供应国防装备的公司
爱沙尼亚已正式指责俄罗斯在8月中旬对向乌克兰供应军用车辆的国防公司Milrem Robotics发动纵火袭击。此次袭击被认为是俄罗斯安全部门指使的破坏行为。爱沙尼亚外交部长表示,此类行为是不可接受的,并召见了俄罗斯驻塔林临时代办。两名拉脱维亚籍嫌疑人因该事件被拘留,该事件导致Milrem Robotics的一处工厂起火。
-
新研究详细介绍了可审计的基于 LLM 的软件修复工作流
一篇新研究论文介绍了一种名为 THEMIS 的工作流,旨在使使用大型语言模型修复软件错误的流程更加透明和可审计。该系统将需求修复的产物外部化,创建语义解释和运行时需求-代码图。对 300 个 SWE-bench Lite 案例的回顾性审计表明,THEMIS 提供了全面的开发者理由和审计记录,便于跨阶段检查和分析修复决策。
-
LLM作为评判者(LLM-as-a-Judge)的评估方法因可靠性和偏见问题受到审视 · 跟踪4个来源
近期研究对大型语言模型(LLMs)在用作评估AI生成文本的评判者时的可靠性提出了担忧。研究表明,LLM评判者可能过度依赖评分标准本身,即使不审阅生成的内容也能给出可预测的分数。此外,当输入文本或评估标准发生变化时,这些模型有时未能调整其判断,这表明其推理能力不够稳健。这项工作强调了深入研究LLM驱动的评估系统的机制和潜在偏见的必要性,尤其是在多语言环境中。
-
Themis框架结合AI可解释性与人类反馈,实现更安全的RL
研究人员推出Themis,一个旨在通过整合可解释性与人类反馈来增强强化学习(RL)系统安全性和透明度的新型框架。该框架旨在通过提供统一的方法来解决防止RL中不期望行为的挑战,同时实现透明度和对齐。Themis支持广泛的环境,并已证明其能够训练出使用人类偏好后表现与真实奖励信号相当或更优的奖励模型,同时还提供了一个可扩展的云平台用于反馈收集和实验管理。