The 2025 Conference on Empirical Methods in Natural Language Processing
PulseAugur coverage of The 2025 Conference on Empirical Methods in Natural Language Processing — every cluster mentioning The 2025 Conference on Empirical Methods in Natural Language Processing across labs, papers, and developer communities, ranked by signal.
-
本地 LLM 测量揭示“思考”和自我批评方面存在问题
运行 Qwen3.5 4B 等本地 LLM 需要仔细测量和验证,因为结果可能不一致。在某些模型中启用“思考”功能,如果超出令牌预算,可能会导致空响应,因此需要读取响应和思考字段或禁用“思考”。自我批评功能并不能可靠地提高准确性,甚至可能降低性能,这凸显了外部、可靠的验证方法的必要性。精确的提示工程,指定确切的输出格式和命名约定,比描述性提示在获得准确结果方面更有效。
-
EMNLP 2025 清单分析揭示对负责任 NLP 的表面合规
一项对 EMNLP 2025 会议的新分析揭示了负责任 NLP 清单存在重大问题,表明它可能只是一个表面化的举措,而非推动真正伦理考量的动力。研究人员发现,作者们常常将伦理问题视为事后诸葛亮,相当一部分清单回复的理由简短、恶意或甚至包含逻辑矛盾。研究还表明,作者倾向于忽视其工作的潜在风险和社会影响,这凸显了清单的意图与其实际执行之间的差距。
-
Google AI 使用小型模型实现卓越的意图提取
Google AI 研究人员开发了一种新颖的方法,利用小型多模态大语言模型(MLLMs)来理解用户通过 UI 交互轨迹传达的意图。该方法将任务分解为两个阶段:首先总结单个屏幕交互,然后从这些摘要中提取整体意图。这项技术使更小、可在设备上运行的模型能够取得与更大、基于服务器的大型语言模型相媲美的结果,为移动和 Web 应用带来了速度、成本和数据隐私方面的优势。