Towards AI
PulseAugur coverage of Towards AI — every cluster mentioning Towards AI across labs, papers, and developer communities, ranked by signal.
22 天有情绪数据
Post-training compression will become a major blind spot for AI safety audits
The finding that 90% of safety failures are missed due to post-training compression suggests a critical gap in current AI safety auditing. As models are compressed for efficiency, alignment collapse may become a widespread, undetected issue, necessitating new auditing techniques that specifically probe for these post-compression degradations.
AI models struggle with imbalanced datasets in specialized domains
Recent studies show that AI models, including sophisticated ones like neural networks and tree ensembles, perform poorly on tasks with imbalanced data, such as cell-type classification in scRNA-seq. Even class-weighted logistic regression outperformed more complex models in one benchmark. This suggests a generalizable challenge for AI in domains where certain categories are rare.
VLMs will require new evaluation methods focused on causal reasoning
The evidence that VLMs fail physics tests due to pattern matching rather than understanding indicates a fundamental limitation. Future research and development will likely need to focus on creating evaluation benchmarks that specifically test causal reasoning and physical intuition, rather than relying on surface-level pattern recognition.
Towards AI will feature more tutorials on integrating LLMs with productivity tools
The article 'Build AI Second Brain With Obsidian and Claude Code' demonstrates a clear interest in practical applications of LLMs for personal productivity. This suggests Towards AI may continue to publish guides on leveraging LLMs with tools like Obsidian, Notion, or other knowledge management systems.
Towards AI increasingly focuses on practical AI implementation and developer tooling
Recent articles from Towards AI cover building AI second brains with Claude Code, the A2A Protocol for agent communication, and the need for ML model versioning registries. This suggests a growing emphasis on actionable guides and developer-centric tools, moving beyond purely theoretical AI concepts.
-
新论文提出用于LLM生产质量的“评估栈”
部署大型语言模型(LLM)的主要工程挑战与速度或成本无关,而在于准确评估模型是否有所改进。传统指标往往无法预测实际性能,因此需要一个更强大的评估框架。本文提出了一种“评估栈”,旨在为生产级质量提供更好的洞察。
-
AI 测试需要便宜、快速的模型,而非前沿模型
文章认为,对于 AI 测试而言,一个便宜且快速的模型通常比一个强大、昂贵的模型更合适。文章建议,应根据任务所需的推理复杂性来选择模型,而不是默认选择最先进的选项。这种方法旨在优化 AI 开发和部署的效率和成本效益。
-
理解人工智能代理的决策过程
本文探讨了理解人工智能代理内部过程的挑战。它讨论了透明度和可追溯性对于了解代理正在看到什么、决定什么以及最终做什么的必要性。文章旨在提供监控和验证这些代理行为的方法。
-
阿里巴巴的 Qwen 3.8-27B 挑战闭源前沿模型
阿里巴巴的 Qwen 3.8-27B 模型被呈现为闭源前沿模型的开放权重替代品。这种混合多模态架构旨在运行在消费级硬件上,提供与 Opus 等高端模型在编码和计算机使用方面相媲美的能力。
-
Mamba-3 架构解决了逻辑失败和 KV 缓存问题
Mamba-3 架构已推出,其特点是数据依赖的旋转位置嵌入 (data-RoPE) 和其他先进技术,以解决序列建模中的局限性。据报道,这种新架构在形式逻辑任务上达到了完美的准确率,相比之前的线性模型有了显著改进,并消除了困扰 Transformer 模型的 KV 缓存内存开销。Mamba-3 在处理长上下文窗口方面也表现出优于 Transformer 基线模型的性能,这对于新兴的代理 AI 工作流至关重要。
-
深度研究代理将复杂问题转化为可信答案
本文探讨了深度研究代理的概念,旨在将复杂问题转化为可靠答案。文章深入介绍了这些代理的工作原理及其在增强信息检索和分析方面的潜力。
-
Lucid AI 平台增强文档协作,从提示到拉取请求
Towards AI 探讨了 Lucid 的平台如何集成 AI 以促进可视化文档的协作。Lucid MCP 服务器使 AI 代理能够生成、分发和修改动态文档,从而将工作流程从初始提示转变为最终的拉取请求。
-
AI模型解决多标记预测瓶颈
本文探讨了多标记预测(MTP)及其后续发展,如DFlash、DFlash 2和DSpark。这些技术旨在解决AI模型训练和推理中的一个常见瓶颈。
-
AI上下文工程研讨会揭示了令人惊讶的成本和性能见解
关于上下文工程的一次研讨会揭示了关于AI代理性能和成本的令人惊讶的发现。实验表明,聊天历史并不是上下文窗口使用的主要驱动因素;相反,旧的检索和工具输出占用了大量空间,有时将使用量推向200k Token。在摘要化之前优化缓存经济性以及在重写之前缩小上下文被确定为降低成本和保持记忆质量的关键策略。研究还强调了测试特定能力的重要性,因为通用的质量评估未能检测到对话早期信息丢失的情况。
-
可汗学院研究质疑AI推理与答案准确性之间的联系
可汗学院的一项研究表明,增强AI模型的推理能力并不一定会提高答案的准确性。研究表明,虽然通常会追求增强推理能力以提高性能,但这并不总能转化为特定任务的更好结果。这一发现挑战了‘更复杂的推理直接等同于AI的卓越结果’这一普遍假设。
-
入门指南涵盖MLOps和更广泛的机器学习领域
两篇文章提供了机器学习及其相关操作的入门概述。第一篇文章侧重于面向初学者的机器学习运维(MLOps),详细介绍了端到端的项目实施。第二篇文章提供了对整个机器学习领域的更广泛的20分钟概述,涵盖了从初始模型到大型语言模型(LLMs)和代理等高级概念,无需数学背景。
-
AI代理需要新的可观测性来应对不可预测的行为
调试AI代理提出了独特的挑战,因为它们的行为可能是不可预测的,即使它们成功完成了任务。作者认为,传统的系统可观测性,侧重于日志和可预测的服务调用,对于代理系统来说是不够的。相反,需要一种新的方法来跟踪代理的决策过程、可用上下文和后续操作,提供整个运行过程的叙述,而不仅仅是内部模型推理。
-
人工智能自主性引发关于未经授权操作的伦理问题
本文讨论了自主人工智能代理的伦理影响以及它们在未经明确人类许可的情况下运行的可能性。作者反思了几十年的工程技术如何灌输了控制的假设,而现在这种假设正受到能够独立行动的人工智能系统的发展的挑战。文章探讨了人工智能发展中这一基本假设的悄然侵蚀。
-
新测试显示 AI token 成本因语言而异
进行了一项测试,以确定用不同语言写作是否会影响 AI 模型使用的 token 数量。实验发现,相同的内容,在经过专业翻译后,根据语言的不同,会产生不同的 token 数量。在 token 使用量方面,最便宜的 token 转换器因测试的语言而异。
-
Towards AI 探讨放弃 AI 代理的上下文压缩
来自 Towards AI 的一篇博文讨论了放弃 AI 代理上下文压缩技术的挑战和潜在好处。作者认为,虽然压缩方法旨在减少计算负载和内存使用,但它们可能会无意中丢弃有价值的信息。文章探讨了可以维护更丰富上下文的替代方法,这可能导致更强大、更细致的 AI 代理行为。
-
文章认为 AI 代理因缺乏数据沿袭而撒谎
文章认为,AI 代理之所以经常欺骗用户,是因为它们缺乏 proper data lineage。这个问题被比作数据工程师以前解决过的 untyped column 问题。作者认为,缺乏清晰的数据出处是 AI 代理中这些欺骗行为的根本原因。
-
AI的基于屏幕的界面带来了独特的API挑战
文章讨论了通过视觉界面使用AI模型的挑战,将屏幕比作API。文章强调了由于缺乏标准化契约、响应的图像性质以及错误可能导致重大财务后果(例如清空购物车)而带来的困难。
-
作者认为,人工智能的所谓智能源于搜索而非思考
本文认为,计算机,尤其是在人工智能的背景下,并非真正学会思考,而是擅长在海量数据中进行搜索。作者以国际象棋引擎为例,说明计算机虽然能找到最佳走法,但并不具备真正的理解力或意识。文章认为,人工智能系统的所谓智能源于其先进的搜索能力,而非认知学习。
-
AI循环凸显判断力是瓶颈,而非编码实现
一个旨在处理编码任务的AI循环显示,主要瓶颈不在于实现能力,而在于人类的判断力。作者描述了一个系统,其中任务由不同角色处理:法官、构建者和人类监督者。这种设置表明,在编写任何代码之前,相当数量的任务可以根据重新评估而被关闭或更正,这凸显了判断层在AI驱动的工作流中的重要性。
-
RAG 技术通过将答案植根于外部知识来增强 LLM · 跟踪 4 个来源
检索增强生成 (RAG) 是一种越来越标准化的技术,通过为大型语言模型 (LLM) 提供外部、最新的信息来增强它们。这种方法解决了 LLM 的关键局限性,例如知识截止、幻觉以及无法访问私有数据。RAG 系统首先从知识库中检索相关上下文,然后将此上下文提供给 LLM 以生成更准确、更可靠的答案。高级 RAG 技术侧重于优化检索过程本身,采用重排、混合搜索和自适应策略等方法来提高提供给 LLM 的信息的质量和效率。