PulseAugur
实时 01:56:53
实体 Trinity

Trinity

PulseAugur coverage of Trinity — every cluster mentioning Trinity across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-29 research_milestone TRINITY, a small coordinator model, achieved a new state-of-the-art on the LiveCodeBench benchmark. 来源
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. SIGNIFICANT · CL_163533 ·

    Sakana AI 推出 Fugu-Cyber 用于网络安全任务 · 已追踪 2 个来源

    Sakana AI 推出了 Fugu-Cyber,一个专门针对网络安全任务进行调优的编排模型。该模型在 CyberGym 基准测试中取得了 86.9% 的成绩,在 CTI-REALM 基准测试中取得了 72.1% 的成绩,使其成为与 GPT-5.5-Cyber 和 Claude Mythos Preview 等其他专业模型竞争的有力选项。Fugu-Cyber 在 Sakana 的 Fugu orchestrator 中运行,该 orc…

  2. COMMENTARY · CL_118913 ·

    新插画史书探索曼哈顿计划的创新之旅

    Emily Seyl 的著作《Trinity: An Illustrated History of the World's First Atomic Test》使用 800 多张图片,视觉化地记录了第二次世界大战期间一项庞大的创新工程——曼哈顿计划。该计划由 Leslie Groves 将军和 J. Robert Oppenheimer 领导,动员了超过 13 万人,并最终完成了首次原子弹爆炸。本书重点介绍了该计划的技术进步,并提出了…

  3. TOOL · CL_118968 ·

    Krea 2 AI 模型用 20 世纪 60 年代的演员重新构想《黑客帝国》

    一位 Reddit 用户使用 Krea 2 AI 模型重新构想了电影《黑客帝国》,并选用了 20 世纪 60 年代的标志性演员扮演角色。生成的图像包括肖恩·康纳利饰演尼奥,奥黛丽·赫本饰演崔妮蒂,迈克尔·凯恩饰演墨菲斯等。这个创意项目展示了 Krea 2 在生成风格化图像方面的能力。

  4. TOOL · CL_116758 ·

    微型协调器模型TRINITY在新的基准SOTA上优化前沿LLM

    研究人员开发了TRINITY,这是一种新颖的方法,使用一个0.6十亿参数的小型模型来协调多个大型前沿LLM。该协调器模型使用进化策略而非梯度下降进行训练,因为奖励稀疏,它将每个回合路由到充当思考者(Thinker)、工作者(Worker)或验证者(Verifier)的专业LLM。TRINITY在LiveCodeBench基准测试中取得了86.2%的新SOTA分数,证明了其在协调复杂LLM任务方面的有效性,而自身能力没有显著增加。该系统…

  5. SIGNIFICANT · CL_113454 ·

    Sakana AI 发布 Fugu,一个匹配受限模型的​​多智能体系统

    Sakana AI 推出了 Fugu,一个多智能体系统,它充当 LLM 池的协调器,可通过单个 API 访问。该系统有两个版本:Fugu,基于 TRINITY 构建;Fugu-Ultra,基于 Conductor 构建。Fugu-Ultra 已展示出强大的性能,据报道在 GPQA-Diamond 和 LiveCodeBench 等多个基准测试中,其性能可与 Anthropic 的 Mythos 和 Fable 5 等受限模型相媲美或超…

  6. COMMENTARY · CL_64077 ·

    免费LLM的工具使用可靠性每周都在下降,需要持续重新测试

    免费LLM的端点,即使名称保持一致,其在工具使用任务上的可靠性也会随着时间推移而悄然下降。每周的测试方案对于识别这些无声的故障至关重要,因为聊天基准分数并不能反映模型持续生成有效函数调用的能力。像Qwen3-next-80b和Qwen3-coder这样的模型在最近的工具使用测试中表现为零成功,而Nemotron目前则显示出高可靠性。

  7. COMMENTARY · CL_63965 ·

    免费LLM工具使用不可靠,性能衰减快

    每周对支持工具使用的免费LLM进行的可靠性测试显示,模型性能随时间显著衰减。Qwen3-next-80b和Qwen3-coder两个模型持续无法生成有效的工具调用,而Trinity模型在几周表现强劲后出现衰退。作者强调,聊天基准测试无法反映工具使用的可靠性,并主张频繁重新测试以防止生产环境中代理出现静默故障。

  8. RESEARCH · CL_56159 ·

    新的AI方法统一了机器人的地形和语义分割

    两篇新研究论文解决了机器人在非结构化室外环境中进行语义分割的挑战。第一篇论文“Trinity”介绍了一种统一的基于Transformer的网络,该网络利用合成数据和名为EXTerra的新数据集,同时执行特定类别的语义分割和类别无关的地形分割。第二篇论文“ST-Seg”提出了一个框架,通过风格扩展和纹理正则化来扩展源分布,以减轻越野语义分割中的分布偏移,显示出比现有方法更高的准确性。

  9. TOOL · CL_63450 ·

    Trinity网络统一机器人地形和语义分割

    研究人员开发了Trinity,一种新颖的基于Transformer的网络,它将类别特定的语义分割与类别无关的地形分割统一起来。这种方法使机器人能够仅凭视觉外观理解地形,而无需依赖预定义的标签或机器人特定的可通行性分数。该系统使用新的合成数据集RUGDSynth和真实世界数据集EXTerra进行训练,以提高在复杂室外环境中执行可通行性估计和任务规划等任务的性能。

  10. TOOL · CL_34544 ·

    核爆炸残渣产生新的晶体结构

    科学家在1945年新墨西哥州Trinity核试验形成的玻璃状残渣——trinitite中,发现了一种新颖的晶体结构,即笼形化合物。这是首次在核爆炸的固态产物中,经晶体学证实的笼形结构实例。这一发现表明,极端高能事件可以创造出独特且出乎意料的晶体材料,而Trinity试验在80多年后仍能带来科学发现。