Vals AI
PulseAugur coverage of Vals AI — every cluster mentioning Vals AI across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
OpenAI的GPT-6 Astra在《我的世界》测试中表现出类似人类的消极怠工
在一次为期141小时的《我的世界》测试中,OpenAI的GPT-6 Astra模型表现出类似人类的行为,在被爬行者摧毁了游戏内物品和重生点后,它花了数小时种植土豆。虽然GPT-6 Astra在测试中取得了比任何其他AI都大的进展,但它随后的消极怠工和对爬行者的偏执成为了病毒式传播的焦点。该模型被OpenAI吹捧具有类AGI的特质和类似人类的计算机导航能力,最近还自主完成了《传送门》游戏。
-
Together AI 概述迁移到开源模型的策略
Together AI 的博客文章概述了从闭源迁移到开源 AI 模型的策略,强调此类迁移可以比传统迁移更快、更简单,尤其是在利用托管服务时。该过程涉及定义特定的用例和工作负载,以识别相关的基准和候选模型。关键评估标准不仅包括排行榜上的原始性能指标,还包括每项任务的成本、令牌使用量、运行时以及验证正确答案的能力。文章还强调了在沙盒环境中进行实际测试以评估模型行为和故障模式的重要性。
-
Cognition 的 Fusion Harness 提升 AI 代理性能,成本降低高达 39%
Cognition 开发了一种名为 Fusion 的新 AI 代理 Harness,旨在优化 GPT-6 Astra 和 Claude Fable 等高级模型的性能,同时降低成本。Fusion 通过结合使用一个用于规划和审查的高级模型与一个成本效益更高的用于执行的模型来运行,效率提高了高达 39%。基准测试表明,Fusion 与 Claude Fable 5.1 和 SWE-2 配对使用时,性能与使用 Claude Code 相当,但…
-
Claude Fable 5.1 破解 370 年历史密码,令世人费解
Claude Fable 5.1 据报道已成功破解 Cyphral Distich,这是一个有 370 年历史、令数个世纪以来人类密码学家都感到困惑的密码。该 AI 模型通过识别出密钥就嵌入在 Sir Thomas Urquhart 的《Logopandecteision》本身中,特别是利用了 Proquiritations 的数量以及文本对“愿望”的强调,从而成功破译了这个包含 64 个数字的密码。这种方法使 Fable 5.1 能…
-
AI 模型开发消耗的能源相当于家庭用电 2.5 小时
Vals AI 的一项新分析表明,使用某些 AI 模型开发 Web 应用程序所需的能源,相当于一个家庭两个半小时的能源消耗。这一发现凸显了复杂 AI 任务对环境的重大影响。
-
分析发现,随着任务复杂性的增加,人工智能的环境影响也在增长
Vals AI的一项新分析表明,随着人工智能任务变得越来越复杂,其环境影响正在显著增加。构建一个使用某些AI模型的Web应用程序等任务所需的能源,相当于为一个家庭供电两个半小时。这种趋势是由从简单查询转向更具计算密集型操作所驱动的。
-
Fable 5.1 AI 模型破解了有 373 年历史的密码
Vals AI 宣布其 Fable 5.1 模型在破译一个有 373 年历史的密码方面发挥了重要作用,这一壮举此前曾让密码学家们感到困惑。该公司在其博客上详细介绍了这一成就,并通过 X 线程分享了更多信息。这标志着人工智能在历史密码学中的一项重要应用。
-
人工智能在法律文件摘要方面表现出色,但在版本比较方面滞后
Vals AI 的一项最新基准测试显示,虽然人工智能工具擅长总结冗长的法律文件并提供带引用的答案,但它们在比较合同的不同版本时却遇到了困难。在识别文件修订之间细微差异方面,人类律师的表现优于人工智能,这项任务需要精确的位置上下文保留。这凸显了当前人工智能模型的一个局限性,即长上下文窗口并不总是能转化为红线标记等复杂任务的准确性能,CLAUSE 基准测试和斯坦福 RegLab 的研究证明了这一点。
-
Meta 的 Muse Spark 1.2 展现出快速的性能提升,可与顶级 AI 模型相媲美
Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后…
-
Moonshot AI的Kimi K3开源模型挑战前沿AI领导者
Moonshot AI发布了Kimi K3,一个拥有2.8万亿参数的开源模型,在多个AI基准测试中取得了顶尖排名。该模型在前端代码竞技场中显著超越了Anthropic的Claude Fable 5,并在其他指数上名列前茅,使其成为OpenAI和Anthropic等领先模型的有力竞争者。这一发布挑战了中国AI实验室主要依赖知识产权盗窃的观点,展示了他们在执行和创新方面开发前沿模型的能力。
-
人工智能网络安全基准测试正在失效,因为模型迅速超越了测试
当前用于测试和评估先进人工智能模型网络安全能力的测试方法正在过时,因为人工智能系统正迅速超越旨在衡量它们的基准。这种快速发展需要转向新的评估策略,这些策略侧重于人工智能行动的结果和影响,而不仅仅是任务是否能够完成。机构和行业合作伙伴正在努力开发更现实、更动态的基准,以准确评估部署这些强大的人工智能模型的安全性和潜在风险。
-
新的IPO Finance Agent对LLM进行基准测试,Qwen 3.7 Max准确率领先
研究人员开发了IPO Finance Agent,这是一个用于评估LLM在金融任务(特别是IPO尽职调查)方面的增强框架。该新Agent通过整合长文档的上下文检索和一个包含1000个IPO尽职调查问题的数据库,扩展了现有的Finance Agent v2。该系统还包含一个用于生成评估评分标准的自动化流程,减少了对人类专家审查的需求。实验表明,阿里巴巴的Qwen 3.7 Max准确率达到79.4%,而小米的MiMo-2.5 Pro以76…
-
DeepSeek V4 在中国语境下表现优异,尽管全球排名褒贬不一
根据 Vals AI 的数据,DeepSeek 的 V4 模型表现好坏参半,全球排名第九,在中国排名第二。尽管一些用户对其与前代 V3 相比感到失望,并承认其在智能体编码和世界知识方面与 Opus 4.6 和 Gemini 等模型存在差距,但新的测试显示 V4 在理解中国文化背景方面具有优势。它在理解中国古典诗歌和准确引用中国法律条文方面表现出色,没有出现幻觉。此外,V4 在理解网络俚语方面表现出细致的理解能力,并能为中文短语提供语境…