PulseAugur
实时 12:55:36
实体 Part 3

Part 3

PulseAugur coverage of Part 3 — every cluster mentioning Part 3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_162874 ·

    参数量低于10亿的大语言模型(LLM)裁判在方向性错误上表现不佳;更大的模型表现出色

    进行了一项实验,以调查大语言模型(LLM)裁判在识别方向性错误方面的准确性,方向性错误是指输出在语义上颠倒了任务指令。研究发现,参数量小于10亿的小型模型在这些错误上存在显著困难,误判了超过三分之一的明确矛盾和近一半的微妙矛盾。参数量大于40亿的大型模型在捕捉明确的方向性错误方面表现出近乎完美的准确性,微妙的错误也显著减少。作者还撤回了之前关于大语言模型(LLM)裁判的虚假说法,并纠正了对特定错误场景的错误描述。