PulseAugur
实时 08:19:03
实体 Tilert

Tilert

PulseAugur coverage of Tilert — every cluster mentioning Tilert across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_191576 ·

    NVIDIA GPU 通过 TileRT 引擎实现每秒 500 个 token 的推理

    通过利用 TileRT 的持久化引擎,NVIDIA GPU 可以实现每秒 500 个 token 的推理速度(每位用户)。据报道,这种配置在相同硬件上性能优于传统设置,从而支持超低延迟的 AI 应用。

  2. COMMENTARY · CL_191514 ·

    NVIDIA 的 TileRT InferenceX 受到专用 AI 硬件的挑战

    SemiAnalysis 正在质疑 NVIDIA 的 TileRT InferenceX 软件在其 GPU 上运行是否能与 Cerebras、Groq 和 SambaNova 等公司的专用 AI 硬件竞争。该软件专为批处理大小为 1 的超高交互性而设计,具有分离式引擎,可实现高吞吐量的预填充和高交互性的解码。

  3. SIGNIFICANT · CL_78352 ·

    小米声称在8GPU上1T参数模型达到1000+ token/秒

    小米的MiMo团队宣布了MiMo-V2.5-Pro UltraSpeed,这是一个拥有1万亿参数的专家混合(Mixture-of-Experts)模型,能够超过每秒1000个token。这一性能是在标准的8GPU服务器上实现的,采用了FP4量化与QAT、DFlash投机解码以及TileRT延迟优化内核等技术。该公司已通过其API以高价向部分用户提供此高速模型。

  4. SIGNIFICANT · CL_78301 ·

    小米在商用GPU上实现1T参数模型每秒1000 token

    小米的MiMo团队发布了MiMo-V2.5-Pro-UltraSpeed,这是其1万亿参数模型的全新推理模式,在商用GPU上实现了超过每秒1000 token的吞吐量。这种显著的速度提升归功于FP4量化、DFlash推测解码和TileRT服务系统的结合,无需定制硬件。该公司声称,这一进步将通过实现更快的并行推理、提高编码代理效率和支持实时决策过程来彻底改变AI应用。

  5. SIGNIFICANT · CL_43383 ·

    智谱AI推出GLM-5.1-highspeed API,速度达400 tokens/s

    智谱AI发布了GLM-5.1-highspeed,这是其GLM-5.1模型的新API,推理速度达到每秒400个token。该新产品被定位为全球领先的LLM提供商中最快的,并在实际测试中表现出色,包括快速的代码生成和内容摘要。速度的提升归功于推理引擎、调度系统和底层基础设施在系统工程方面的显著优化,旨在通过减少等待时间和提高反馈频率来改善AI代理的用户体验。