PulseAugur
实时 08:19:39
实体 Looped Transformer

Looped Transformer

PulseAugur coverage of Looped Transformer — every cluster mentioning Looped Transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_203885 ·

    Nanbeige4.2-3B 模型已修复 Apple Silicon 部署问题

    一篇新论文详细介绍了在 Apple Silicon 上部署 Nanbeige4.2-3B 模型(一个拥有 30 亿参数、采用 Looped Transformer 架构的 agentic 模型)所面临的挑战及解决方案。研究人员发现了五个阻止该模型在 Hugging Face Transformers 上运行的关键 bug,包括 RoPE 缓冲区和 API 调用问题。此外,该模型的层重用策略导致了显著的内存开销,限制了其有效上下文宽度。…

  2. SIGNIFICANT · CL_156061 ·

    Nanbeige/Nanbeige4.2-3B 模型在 3B 规模下提供强大的代理能力

    Nanbeige/Nanbeige4.2-3B 模型是一个拥有 30 亿参数的语言模型,专为代理任务设计,拥有强大的推理和对齐能力。它采用了 Looped Transformer 架构,在不增加参数的情况下增强了容量。在代理和推理基准测试中,该模型表现出与 Qwen3.5-9B 和 Gemma4-12B 等更大模型相媲美的性能,并专为本地个人助理应用而设计。

  3. TOOL · CL_147972 ·

    循环Transformer偏好编码研究纠正重大错误

    一篇研究论文详细介绍了循环Transformer如何通过在冻结的Ouro-2.6B循环迭代状态上训练轻量级评估器头来编码人类偏好。该研究最初声称在偏好解码方面具有高准确性,但后来发布了勘误,纠正了重大的评估错误。这些错误夸大了结果,包括成对评估器的准确性(这是数据排序的产物)以及因数据泄露而受损的点状探测。虽然关系偏好解码比点状解码更准确的中心发现仍然成立,但其幅度比最初报告的要小,并且修正后的数值无法与端到端奖励模型相媲美。

  4. TOOL · CL_51214 ·

    全循环Transformer提高了训练稳定性和性能

    研究人员开发了一种全循环Transformer架构,以解决迭代Transformer模型中的训练不稳定性问题。这种新架构引入了无参数修改,包括全循环架构和注意力注入,以减轻梯度振荡和残差爆炸。这些增强功能使得训练最多12次循环迭代成为可能,性能优于基线循环模型,并将下游任务性能提高了13.2%。全循环Transformer还通过在推理时调整循环迭代次数以适应不同的计算预算,提供了适应性。