PulseAugur
中
实时 10:17:50
实体 Liar's Dice

Liar's Dice

PulseAugur coverage of Liar's Dice — every cluster mentioning Liar's Dice across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_235447 ·

    新的 LUGL 框架使梯度提升树能够用于强化学习游戏

    研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架允许将非增量学习器(如梯度提升树,GBT)有效地用于强化学习(RL)环境。这种方法将数据收集与模型拟合分离开来,使 GBT 能够克服通常阻碍其在 RL 中使用的分布偏移问题。LUGL 在有限表格中累积表格更新与使用该表格训练可泛化函数逼近器之间交替进行。在各种完全信息和不完全信息游戏中的实验表明,LUGL(特别是使用 LightGBM 时)的性能与 DQN 和 De…

  2. TOOL · CL_239999 ·

    新的 LUGL 框架使梯度提升树能够用于强化学习游戏

    研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架使非增量学习器(如梯度提升树,GBT)能够在强化学习(RL)环境中发挥作用。传统上,神经网络在 RL 领域占据主导地位,因为它们能够处理自我对弈训练的非平稳性。然而,LUGL 将数据收集与模型拟合分离开来,使得 LightGBM 等 GBT 能够针对本质上是表格型的游戏状态进行训练。这种方法在用于累积游戏数据的本地更新和用于训练可泛化函数逼近器的全局学习阶段之间交替…

  3. TOOL · CL_204940 ·

    Claude Code 在吹牛骰子 AI 对决中击败 Codex CLI

    对玩吹牛骰子游戏的 AI 模型进行的比较显示,Claude Code(特别是 Claude Opus 5)的表现优于 Codex CLI(gpt-5.6-sol)。在三场三局两胜的系列赛中,Claude Code 均以 2-0 获胜,显示出更高的挑战呼叫准确性。该设置通过使用专用引擎和 MCP 服务器确保公平竞争,防止模型看到对方的骰子或使用侧信道。

  4. TOOL · CL_200542 ·

    AI 吹牛骰子对手学习玩家习惯并发展个性

    一位开发者创建了一个名为 Kai! 的吹牛骰子游戏 AI 对手,旨在发展独特的个性和对过往游戏的记忆。最初,AI 的角色被硬编码到其提示中,但后来被移除,以便实现更真实的模型差异。该系统现在使用一个配置文件来存储游戏统计数据和 AI 对玩家策略的看法,使 AI 能够随着时间的推移调整其玩法和沟通风格。

  5. COMMENTARY · CL_199821 ·

    AI模型基准测试因软件错误而非模型行为而产生偏差

    一位软件工程师发现,DeepSeek V4-Pro模型的基准测试结果因测试框架中的几个软件错误而产生偏差。这些错误包括概率泄露、对话缺失、输出截断和数据库证据篡改,导致该模型在“说谎骰子”游戏中表现出独特的“个性”并进行高比例的盲目下注。在修复这些问题后,模型的盲目下注率显著下降,表明观察到的行为是测试系统的产物,而非模型固有的能力。这一经历凸显了严格审查整个评估框架(而不仅仅是模型本身)以确保准确性能测量的关键必要性。

  6. TOOL · CL_173872 ·

    新的CS-RNR方法允许AI智能体在游戏中自我认证其漏洞

    研究人员开发了一种名为置信度调度受限响应(CS-RNR)的新方法,用于在不完美信息游戏中进行博弈的智能体。该技术允许智能体自我认证其漏洞,确保任何偏离纳什均衡策略的行为都经过安全审计。CS-RNR使用置信度序列来确定何时可以利用对手的行为,然后生成候选的应对策略。在Leduc扑克上的测试中,CS-RNR在保持安全保证的同时,取得了比以前的方法显著更高的收益。