ByteDance Seed
PulseAugur coverage of ByteDance Seed — every cluster mentioning ByteDance Seed across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
字节跳动HarnessDev基准测试,评估LLM构建代理代码的能力
来自字节跳动Seed及其他机构的研究人员推出了HarnessDev,这是一个旨在评估LLM创建自身代理工具链能力的新基准。与固定工具链的传统基准不同,HarnessDev评估的是LLM自身生成的工具链代码的质量。初步结果表明,虽然LLM可以改进它们的工具链,但只有一部分改进能够泛化到不同的任务中,这表明完全自主改进的代理仍然是一个重大挑战。
-
开放权重模型取得进展,Agent工程在研究和教育领域获得关注
近期AI新闻重点关注开放权重模型和Agent工程的进展。DeepSeek V4 Flash Vision权重现已开放,提供可与领先模型媲美的视觉能力。GLM-5.3 Flash在Agent基准测试中表现强劲,成功率和成本效益显著。腾讯的Hy4 Preview,一个大型MoE模型,在Agent能力和稳定性方面也显示出显著进展。在教育领域,斯坦福大学正通过新课程正式推进AI原生软件工程,重点关注Agent构建和面向系统的开发,超越了简单的提示。
-
ByteDance 和 清华AIR 训练大语言模型使用 CUDA Agent 编写更快的 GPU 代码
ByteDance Seed 和 清华AIR 开发了 CUDA Agent,一个使用强化学习训练大语言模型生成优化 GPU 核的系统。该系统在 KernelBench 基准测试中达到了 98.8% 的正确率,并且生成的核比编译器生成的代码快 96.8% 的时间。该 Agent 在模拟的 CUDA 开发环境中运行,结合了性能分析和正确性检查来提高核性能,在 AI 基础设施和其他延迟敏感领域具有潜在应用。
-
字节跳动推出Seed 2.1 Turbo,支持262k上下文且成本低廉
字节跳动发布了其Seed 2.1 Turbo模型,该模型拥有高达262.1k token的上下文窗口。该新模型定位为最具成本效益的长上下文处理解决方案之一,定价为每百万token输入0.5美元,每百万token输出2.5美元。另一相关模型Seed-2.0-Code也提供相同的上下文长度和类似的定价结构。
-
字节跳动种子团队的SpatialTree框架被CVPR 2026接收
字节跳动种子团队与学术界合作伙伴合作,推出了SpatialTree,一个旨在增强多模态大语言模型(MLLMs)空间智能的新型分层框架。该新框架旨在改进MLLMs感知、理解和推理数据中空间关系的方式。该研究已被CVPR 2026接收,表明其在人工智能研究领域的潜在重要性。