python-coverage
PulseAugur coverage of python-coverage — every cluster mentioning python-coverage across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新基准评估人工智能生成的法律报告中的引文可信度
研究人员开发了LegalCiteTrust,一个旨在评估中文长篇法律研究报告中引文可信度的新基准。该基准从覆盖度、支持度和引文可信度三个维度评估报告,其中引文可信度又细分为存在性、保真度和适用性(E/F/A)。使用各种LLM和研究系统进行的实验表明,检索工具可以增强证据支持,但不能可靠地提高引文可信度。研究结果表明,可靠的法律研究生成需要引文感知治理,确保检索到的法律权威不仅被找到,而且被准确描述并恰当应用。
-
Hugging Face论文揭示LLM中的“潜移学习”,影响可审计性
Hugging Face的一篇新论文探讨了语言模型中“潜移学习”的概念,即学生模型可以通过不明确命名这些特征的蒸馏数据从教师模型继承隐藏特征。研究确定“通道位置”是决定在训练前是否可以审计这种转移的关键因素。研究发现,根据特征是在主体通道中还是依赖于词汇几何结构,存在不同的转移机制,这表明标准的预训练筛选并非总是能有效审计这些隐藏特征。研究结果表明,即使移除了特定的训练标签,相关的偏好仍然可以转移,这凸显了对细致审计策略的需求。
-
Eugene Yan 和 Practical AI 讨论测试机器学习系统和代码
Eugene Yan 的文章详细介绍了一种测试机器学习系统的综合方法,区分了传统软件测试和特定于机器学习的测试。机器学习测试进一步分为用于实现正确性的预训练测试、用于预期学习行为的后训练测试以及用于性能评估的评估指标。作者使用 DecisionTree 实现和泰坦尼克号数据集来演示这些测试方法,并结合了单元测试、代码覆盖率、代码风格检查和类型检查等实践。