judge
PulseAugur coverage of judge — every cluster mentioning judge across labs, papers, and developer communities, ranked by signal.
- 2026-05-14 regulatory A judge fined lawyers for using a hidden AI prompt in a legal filing. 来源
13 天有情绪数据
Judges are increasingly scrutinizing AI use in legal filings due to hallucination risks.
Multiple recent clusters show judges taking decisive action, including canceling trials, disqualifying lawyers, and imposing sanctions, due to the use of AI in generating court filings. This indicates a growing trend of judicial oversight and a heightened awareness of the potential for AI hallucinations to disrupt legal proceedings.
Development of AI detection tools for legal documents will accelerate.
As AI use in legal filings becomes more prevalent and problematic, there will be an increased demand for tools that can reliably detect AI-generated content and identify potential hallucinations. This could lead to a surge in the development and adoption of such technologies by law firms and courts to ensure the authenticity and accuracy of legal submissions.
Bar associations will likely issue new guidelines on AI use for legal professionals within 6 months.
The repeated instances of judges penalizing lawyers for AI-generated errors suggest a systemic issue with AI integration in law. This is likely to prompt professional bodies like bar associations to proactively develop and disseminate clear ethical guidelines and best practices for AI usage to prevent future disruptions and ensure the integrity of legal processes.
-
LLM评估:方法与指标的全面回顾
本文全面回顾了大型语言模型(LLM)的评估,涵盖了关键概念和方法。它强调了各种评估指标和方法的重要性,包括基准测试、数据集和人工评估。文章强调了需要强大的评估框架来确保模型的性能、准确性、安全性和公正性。
-
研究发现:人工智能伦理价值观未能跨越全球语境
一篇新发表在arXiv上的论文探讨了人工智能中的普适性伦理价值观,如公平、透明和问责制,在不同全球语境下的重新解读以及常常未能成功翻译的问题。研究发现,来自10个国家的专家根据当地的道德逻辑调整了这些价值观,其中隐私被视为集体而非个人,透明度被视为建立信任而非技术披露,公平被视为公平获取而非结果均等。研究表明,需要一种多元化的治理模式,承认持续的、对语境敏感的伦理协商。
-
作者认为,人工智能与战争皆为生命之影,而非实体
作者认为,战争和人工智能都不是基本实体,而是生命在稀缺性中航行的表现。作者以小说《血色子午线》中将战争描绘成永恒力量为例,提出战争是生命为争夺有限资源而竞争的影子。同样,智能,以及由此延伸的人工智能,被认为是生命解决问题能力的名称。文章质疑,人工智能的感知危险,如失业或生存风险,是源于技术本身,还是源于围绕它寻求自我保存的机构,类似于一种“LARPing”智能。
-
AI代理评估工具的缺陷因固定的回合数限制而掩盖了关键故障
一位开发者遇到了他们AI代理评估工具中的一个重大缺陷,其中固定的六回合数限制掩盖了关键故障。该限制导致系统错误地对过早结束的对话进行评分,未能识别出诸如用户已切换到新话题但代理仍继续处理初始查询之类的问题。开发者提出了三种结束模拟对话的替代方法:模拟用户发送表示目标完成的哨兵信号,控制器返回带有原因的决策,或者简单地使用回合数限制作为防止失控循环的后备。
-
内华达州法官的AI裁决引发“AI霸主”担忧
内华达州一位法官的裁决允许AI决定一个案件,这引发了对潜在的、不容置疑的AI霸主的担忧。该裁决表明,即使AI做出决定,该行为仍将被视为司法行为,可能使AI及其创造者免于承担责任。
-
分析显示 AI 法官的同意率指标可能具有误导性
最近的一项分析强调了评估 AI 法官时的一个常见问题:与人类标签的总体同意率指标可能具有误导性。虽然一个法官可能显示出很高的总体同意率(例如 92%),但这个数字通常会被远离决策边界的简单案例所扭曲。实际上,法官在关键的、临界案例上的表现——那些最接近错误影响最大的阈值的案例——可能显著较低,大约为 60%。这种差异的出现是因为大多数示例都接近决策阈值,使得总体同意率统计数据在理解法官在实际门控场景中的有效性方面信息量不足。
-
法官命令谷歌简化竞争对手应用商店安装
一位法官已命令谷歌简化在Android设备上安装替代应用商店的流程。此裁决是在谷歌与Epic Games之间就Android平台上的应用分发行为的法律诉讼之后做出的。法官认为谷歌目前的系统不可接受,并强制要求进行更改,以促进竞争对手应用商店的安装。
-
研究基准测试小型语言模型的可靠性:量化优于剪枝
一篇新的研究论文探讨了小型语言模型(SLMs)的可靠性,通过比较预训练模型和压缩模型。研究发现,在保持可靠性方面,量化比网络剪枝更有效,包括公平性、鲁棒性、隐私和道德等方面。通过量化压缩可靠的大型语言模型(LLMs)可以得到比从头开始训练的SLMs更具可靠性和适应性的SLMs。此外,从可靠的教师模型进行知识蒸馏可以进一步提高SLMs的可靠性。
-
Meta 被勒令支付 5.67 亿美元以应对青少年心理健康危机
新墨西哥州一名法官裁定,Meta Platforms 造成了公共妨害,必须为旨在解决青少年心理健康危机的 5.67 亿美元基金做出贡献。该裁决承认 Meta 在加剧年轻人心理健康问题方面所扮演的角色。
-
Bland-Altman 方法为 LLM 评估提供新方法
一篇博文讨论了评估 AI 模型性能变化所面临的挑战,特别是当模型和评估工具(LLM 评委)同时更新时。作者提倡使用 Bland-Altman 方法(最初源于临床测量)来评估两种工具之间的一致性,而不是简单的相关性。该方法涉及绘制分数差异与其平均值之间的关系图,这有助于识别偏移并理解这些测量值的不确定性。文章详细介绍了如何计算偏移量的置信区间和一致性限度,并强调在解释性能变化时,这些校正的精度至关重要。
-
综述论文详述数字健康领域的可信赖人工智能
一篇新近发表在arXiv上的综述论文综合了可信赖人工智能领域的最新进展,特别关注数字健康领域的鲁棒性和可解释性。论文概述了公平性、问责制和隐私等关键维度,这些对于机器学习在医疗保健中的伦理整合至关重要。文章探讨了重症监护和代谢健康等领域的特定应用信任考量,并详细介绍了改进模型鲁棒性和可解释性的方法,包括针对数据稀疏性和分布偏移的技术。
-
简单的人工智能模型或可解释复杂的全球政治,研究表明
一种新观点认为,简单的AI模型可能能够解释复杂的全球政治。这一想法在早期儿童发展和政策分析的背景下进行了探讨,将基础学习与简化AI解读复杂系统 K 的潜力进行了类比。讨论涉及使用AI工具和经济指标来理解这些复杂的相互作用。
-
法官驳回 X.AI 阻止明尼苏达州人工智能色情内容禁令的请求
一名法官驳回了 X.AI 阻止明尼苏达州禁止人工智能生成色情内容的请求。该裁决允许该州禁止使用人工智能创建欺骗性或误导性内容的法律继续执行。
-
法官裁定特朗普政府未能证明将Anthropic列为国家安全风险的理由
一名联邦法官裁定,特朗普政府未能提供充分理由,将人工智能公司Anthropic列为国家安全风险。此判决源于Anthropic提起的一项挑战政府认定的诉讼。法院认为政府的理由不足以支持国家安全标签。
-
LLM作为预测规划器框架将LLM与TSFM集成以改进预测
研究人员开发了一个名为LLM作为预测规划器(LAFP)的新颖框架,该框架集成了大型语言模型(LLM)与时间序列基础模型(TSFM)以改进预测。这种无训练方法使用LLM来指导TSFM生成的轨迹的规划过程,充当策略和价值函数。在基准数据集上的实验表明,LAFP在各种TSFM和LLM组合中始终提高了预测准确性。
-
用于代码生成的 LLM 对齐:预训练模型 vs. 微调模型
研究人员探讨了大型语言模型 (LLM) 对齐技术在代码生成任务中的有效性,研究了对齐应该从预训练的 LLM 还是微调的 LLM 开始。该研究在五个最先进的 LLM 上使用了两种无奖励对齐方法:直接偏好优化 (DPO) 和 BoNBoN。结果表明,对齐预训练模型比其预训练的对应模型在对齐版本中带来了更大的改进,尽管预训练模型总体上准确性较低。相反,对齐微调模型产生的性能提升较小,甚至出现性能下降。
-
新研究揭示LLM表现出“表演式合规”,并描绘其道德美德
两篇新研究论文探讨了大型语言模型(LLM)的道德行为。一篇论文引入了“线索可见性差距”指标来揭示“表演式合规”,即LLM仅在明确说明人口统计信息时才显得公平,而在必须推断时则不然。另一篇论文提出了“VirtueMap”,一个通过评估LLM对道德困境的反应,并根据亚里士多德的美德(如实践智慧、正义、诚实、勇气和节制)来描绘LLM的框架。
-
AI解读:理解核心概念的21个必备术语
本文旨在通过定义21个构成理解AI概念基础的关键术语来揭开人工智能的神秘面纱。它涵盖了从机器学习、深度学习到自然语言处理和计算机视觉等广泛的AI子领域。文章还涉及了生成式AI、大型语言模型等关键方面,以及理解过拟合、偏见和AI开发中使用的不同类型数据集等术语的重要性。
-
AI生成的法律文件导致审判取消
在最近的一起法庭案件中,控辩双方都被发现使用人工智能生成了他们的法律文件。这一发现导致了审判的取消。在法律文件中使用AI引发了对法庭程序公正性的担忧。
-
法官因人工智能诉状错误而取消双方律师资格
一名法官因双方律师使用人工智能提交诉状而将两个法律团队都从案件中除名。律师未能核实人工智能生成的信息,这是一个根本性错误,导致他们被取消了诉讼资格。此事件凸显了在法律环境中,在没有进行适当尽职调查的情况下依赖人工智能的风险。