PulseAugur
实时 07:56:48
实体 Tri Dao

Tri Dao

PulseAugur coverage of Tri Dao — every cluster mentioning Tri Dao across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. COMMENTARY · CL_201404 ·

    开源AI模型正迅速缩小与闭源实验室的差距

    开源AI模型在质量上正迅速赶上专有系统,滞后仅几个月。推理栈的进步,包括内核、引擎和投机解码技术,进一步加速了这一进展。这些发展表明,开源社区正在显著缩小与领先的闭源AI实验室之间的差距。

  2. COMMENTARY · CL_197910 ·

    Tri Dao:AI的下一个突破是渐进式优化,而非新架构

    Tri Dao在国际机器学习会议上表示,AI下一个重大的架构性突破不太可能来自单一的创新。相反,他认为进展将是渐进式的,重点在于优化内核、推理栈和集群运营。Dao强调,许多关键的开发工作正在开源社区中进行。

  3. TOOL · CL_192302 ·

    推测性解码走向成熟,加速 LLM 推理

    推测性解码是一种加速 LLM 推理的技术,已取得显著成熟,相关框架纷纷采用,用户也报告了令人印象深刻的性能提升。尽管核心概念已存在多年,但其在 2026 年的广泛采用和有效性归功于 Tri Dao 等人的“Speculative Speculative Decoding”论文等突破性进展。一些人认为,这项进展对于本地 LLM 推理的重要性堪比之前的 FlashAttention。

  4. TOOL · CL_137829 ·

    Together Computer 在 ICML 发表演讲,讨论推理优化

    Together Computer 在国际机器学习大会 (ICML) 上发表了七篇论文。该公司还与 NVIDIA 和 Lyra Labs 一起举办了名为“水族馆之夜”的活动。此次活动邀请了 Tri Dao 和 Misha Ryabinin 讨论推理优化、开源模型以及研究成果的生产转化。

  5. COMMENTARY · CL_127881 ·

    Together AI、NVIDIA、Lyra Labs 将在 ICML 主办人工智能炉边谈话

    Together AI 与 NVIDIA 和 Lyra Labs 合作,将在国际机器学习大会上举办一场炉边谈话。讨论将聚焦于人工智能研究和基础设施的未来发展轨迹,由 Tri Dao 领导。

  6. RESEARCH · CL_115129 ·

    开源AI中Transformer注意力机制的演进

    自诞生以来,Transformer架构的注意力机制经历了显著的演进,众多创新为更高效、更强大的大型语言模型做出了贡献。FlashAttention、多查询注意力(MQA)、分组查询注意力(GQA)和滑动窗口注意力(SWA)等创新极大地降低了内存需求并提高了推理性能。最新的进展,包括门控Delta网络(GDNs)等线性注意力变体和原生稀疏注意力(DSA)等稀疏注意力方法,正在进一步拓展边界,许多开源模型都采用了这些技术。

  7. SIGNIFICANT · CL_55057 ·

    阿里巴巴的Qwen3.5在代理工作负载上达到创纪录的580 tps

    阿里巴巴的Qwen团队在TokenSpeed引擎上为代理工作负载创造了每秒580万亿个token的新纪录。这一显著的性能提升是在几家关键合作伙伴的帮助下实现的。这一成就凸显了AI模型在复杂任务效率方面的进步。

  8. TOOL · CL_47658 ·

    Together AI 内核团队使用 FlashAttention 优化 GPU

    Together AI 内核团队,包括研究员 Dan Fu 和 Tri Dao,开发了 FlashAttention,这是一个显著优化 AI 模型 GPU 性能的软件层。这项突破通过将数据库系统原理应用于 GPU 内存移动,实现了 2-3 倍的速度提升,挑战了 transformer attention 已经完全优化的观念。该团队后续的工作,包括 ThunderKittens 库,旨在加速 NVIDIA Blackwell GPU 等…

  9. SIGNIFICANT · CL_44363 ·

    Together AI 借助 NVIDIA Blackwell 将 AI 训练速度提升 90%

    Together AI 推出了采用 NVIDIA Blackwell 平台的新 GPU 集群,显著加快了 AI 训练和推理速度。这些集群由 Together Kernel Collection 提供支持,与之前的 NVIDIA H100 硬件相比,训练速度最高可提高 90%,处理大型模型的速度超过每秒 15,000 个 token。Salesforce 和 Zoom 等早期客户已报告了显著的性能提升,其中一些客户的训练速度翻倍。Tog…