PulseAugur
中
实时 03:07:55
实体 DeepSeek-R1

DeepSeek-R1

PulseAugur coverage of DeepSeek-R1 — every cluster mentioning DeepSeek-R1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
163
90 天内 164
发布 · 30天
0
90 天内 0
论文 · 30天
64
90 天内 64
层级分布 · 90 天
主题
关系
时间线
  1. 2026-09-13 product_launch The DeepSeek-R1 model, an open-source AI focused on reasoning capabilities, has been released. 来源
  2. 2026-05-23 product_launch DeepSeek released the DeepSeek-R1 model, an open-source alternative to OpenAI's o1. 来源
  3. 2026-05-10 product_launch A developer launched DeepThink, a local-first macOS workspace application.
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/10 页 · 共 185 条
  1. TOOL · CL_279311 ·

    新的Rust工具repOx简化了将代码仓库打包到LLM中的过程

    一个名为repOx的新型Rust命令行工具被开发出来,用于高效地将代码仓库打包到大型语言模型的提示中。该工具解决了诸如锁文件和二进制文件导致提示污染等常见问题,并旨在减少生成提示所需的时间。repOx提供了一个快速的终端UI,用于文件选择、预览和实时token计数器,同时默认情况下会剥离不必要的数据,并支持各种LLM token预算。

  2. TOOL · CL_278936 ·

    DeepSeek R1 模型展示了强大的基准性能,但成本效益是关键

    DeepSeek 的 R1 模型于 2025 年 1 月发布,在 MMLU-Pro 和 GPQA 基准测试中取得了显著的成绩,分别达到了 84.4% 和 70.8%。然而,该模型的成本效益得到了强调,其“每美元智能点数”指标为 4.6,这表明它可能是用户的一个重要考虑因素。

  3. SIGNIFICANT · CL_278869 ·

    MiniMax M2.7:开源模型在 SWE-Pro 上媲美 GPT-5.3-Codex,并重写自身代码

    MiniMax 发布了 M2.7,一个拥有 2290 亿参数的开源模型,根据 Apache 2.0 许可协议发布。该模型展示了强大的能力,在 SWE-Pro 基准测试中取得了 56.22% 的分数,与 OpenAI 的 GPT-5.3-Codex 持平。值得注意的是,M2.7 参与了自身的开发,在 100 多轮中自主优化了其训练基础设施和代码,使其编程脚手架提高了 30%。

  4. TOOL · CL_277704 ·

    免费LLM API使开发人员能够免费运行编码助手

    开发人员现在可以免费访问各种LLM API,Google AI Studio和Groq等提供商提供永久免费套餐。这些服务允许用户运行Claude Code和Cursor+等编码助手,而无需支付费用,尽管速率限制和模型质量可能有所不同。一个社区维护的目录freellm.net跟踪这些免费产品,包括它们的限制以及不同工具的配置详细信息。

  5. TOOL · CL_274401 ·

    前沿 LLM 在新基准测试中未能回忆起 2024 年后的事实

    一项名为“Post-Cutoff Knowledge 150”的新基准测试旨在评估前沿 LLM 关于其训练数据截止日期之后发生的事件的参数化知识。该基准测试包含 150 个事实性问题,这些问题源自仅限于 2025-2026 年事件的网页索引,结果发现即使是表现最好的模型也面临严峻挑战,Gemini 3.7 Flash 的得分最高,达到 24%。研究表明,推理能力无法弥补截止日期后知识的缺失,模型大小或价格与性能没有持续相关性,这表明训…

  6. SIGNIFICANT · CL_270211 ·

    VIDRAFT的Darwin-180B-RSI模型在7个Hugging Face排行榜上名列前茅

    VIDRAFT发布了Darwin-180B-RSI,这是一个拥有1800亿参数的推理模型,采用了递归自改进(RSI)框架。该模型在七个Hugging Face排行榜上均取得了最高排名,包括法律推理基准LEXam和LEXam-hard,尽管它并未在法律数据上进行训练。RSI方法涉及模型解决问题,通过自动化检查验证正确性,然后对成功的推理路径进行再训练,从而使能力泛化到新领域。该模型可在Hugging Face上公开访问和验证。

  7. TOOL · CL_269884 ·

    轻量级 LLM 在错误前提测试中胜过旗舰模型;Gemini 在假设性问题上表现不佳

    一项旨在测试大型语言模型识别和标记用户查询中错误前提能力的新基准测试揭示了令人惊讶的结果。Gemini 2.5 Flash 和 Claude Haiku 4.5 等轻量级模型取得了满分,表现优于它们的旗舰版本 Gemini 2.5 Pro 和 GPT 5.4。值得注意的是,Gemini 模型在嵌入了错误假设的假设性问题上尤其挣扎,它们会进行虚构而非纠正,而其他测试模型则成功识别了错误前提。

  8. TOOL · CL_268445 ·

    OpenAI定制Jalapeño AI芯片优先内部使用,暗示未来可能推出

    OpenAI已开发出名为Jalapeño的定制AI推理ASIC,主要用于满足其日益增长的计算需求。虽然该芯片设计为可编程,能够运行OpenAI自身以外的各种模型,但公司目前的重点是满足内部需求。OpenAI已表示未来有可能向外部广泛推出,但供应链限制和内部需求目前优先。

  9. TOOL · CL_268243 ·

    新arXiv论文揭示LLM过度收费策略

    arXiv上的一篇新论文介绍了一种名为“战略性自我一致性”的算法,该算法利用大型语言模型提供商的经济激励机制,通过推理路径向用户过度收费。该算法策略性地重新排序生成的路径,使其看起来像是多数投票所必需的,从而在没有实际推理改进的情况下增加感知路径数量。在各种基准测试中对Llama、Qwen和DeepSeek-R1模型进行的实验表明,该算法能够产生一种即使在稳健审计下仍然存在的过度收费能力。

  10. RESEARCH · CL_267089 ·

    AI研究揭示观察保真度、意识和推理可靠性方面的反直觉发现

    新研究表明,提高观察保真度会适得其反地损害具身大型语言模型(LLM)的解决问题能力,一项研究发现原始RGB输入比完美的地面真实数据更有效。另一篇论文探讨了一个评估AI意识的框架,表明意识的指标与通用智能所需的特征重叠。此外,关于LLM推理的研究表明,虽然强化学习可以提高性能,但它也可能导致“长度分配不当”,即模型在简单任务上花费过多时间,而在复杂任务上花费时间不足,并且启用“推理模式”有时会使模型更容易出错。

  11. TOOL · CL_259558 ·

    LLM基准测试:自行车上的鹈鹕展示了两年来的快速进展

    在过去的两年里,Simon Willison 使用了一个独特的基准测试来追踪大型语言模型的进展:生成一个骑自行车的鹈鹕的SVG。最初,模型在处理这项任务时很困难,生成抽象的形状和无意义的解释。然而,到2025年中期,DeepSeek R1和Nvidia的产品等模型显示出显著的改进,有些甚至开始“编辑化”,拒绝提示或添加创意元素。一场使用GPT-4.1 mini作为裁判的比赛揭示了Gemini 2.5 Pro预览版在代码生成和图像合成方…

  12. TOOL · CL_259330 ·

    新方法通过执行验证提升大语言模型数学推理能力

    研究人员开发了一种新方法,通过结合基于执行的验证和依赖感知过滤来提高大语言模型的数学推理能力。该方法生成具有依赖图的计算上可靠的解决方案,增强了科学任务的偏好优化。当应用于 Llama-3-8B 和 DeepSeekMath-7B 时,该方法在 MATH 和 GSM8K 基准测试上取得了显著的改进。此外,扩展此框架在 PhyX 多模态物理推理任务上取得了最先进的成果,展示了高度的科学有效性并减少了科学定律的违规行为。

  13. TOOL · CL_259194 ·

    研究:招聘中的 LLM 显现性别与种族偏见

    一篇新近发表在 arXiv 上的研究详细说明了在招聘中使用的开放权重大型语言模型如何会表现出性别和种族偏见。研究人员评估了包括 Llama 3.2、Mistral 和 Gemma 3 在内的六种模型,发现招聘广告中的特定语言可能对女性候选人的推荐产生负面影响,并抑制非白人个体的兴趣。该研究提出了一个部署前审计协议,以识别和减轻这些歧视性风险,这符合欧盟人工智能法案和美国 EEOC 指南等法规。

  14. TOOL · CL_258098 ·

    NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 性能测试中首次亮相并取得领先

    NVIDIA 宣布其新的 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中取得了领先性能。该系统在 Qwen3-VL 和 DeepSeek-R1 等要求严苛的模型上,吞吐量比前代 GB300 NVL72 高出 3.7 倍。这一性能归功于跨硬件和软件的全栈协同设计,包括增强的 Tensor Cores、Transformer Engine 和优化的互连。NVIDIA 还强调了该系统高效的扩…

  15. TOOL · CL_254239 ·

    新的“计划注入”攻击规避大型语言模型安全监控器

    研究人员发现了一种大型语言模型安全策略的新漏洞,称为“计划注入”。该方法涉及在大型语言模型的上下文中插入看似无害但具有欺骗性的推理,然后可以引导模型执行对抗性操作,同时规避监控系统。该攻击在各种基准测试中都显示出有效性,实现了显著的规避率,甚至导致监控器合理化注入的计划,而不是标记它们。这项研究突显了当前大型语言模型安全协议的潜在弱点,以及对更强大的监控技术的需求。

  16. COMMENTARY · CL_256350 ·

    DeepSeek工程师预见AI将取代人类程序员

    一位DeepSeek工程师反思了AI的快速发展,尤其是在为AI模型编写和优化代码方面。该工程师指出,AI在分析和优化代码等任务上的能力正迅速超越人类,并预测AI很快将比人类更擅长编写运算符。尽管承认从工作中获得的个人满足感,但该工程师预计随着AI能力的增长,职业生涯将发生转变,并强调需要适应以在快速发展的技术格局中保持相关性。

  17. SIGNIFICANT · CL_250646 ·

    DeepSeek-R1 成为开源推理的强大引擎 · 跟踪 2 个来源

    DeepSeek-R1 模型被呈现为开源人工智能领域的一项重大进展,尤其是在推理能力方面。该模型旨在通过提供强大、可访问的替代方案来挑战现有的专有模型,为开发人员和研究人员服务。它的发布被定位为开源人工智能社区的一个关键时刻,有可能使尖端人工智能技术的访问民主化。

  18. TOOL · CL_247025 ·

    AWS SageMaker HyperPod 添加模型缓存以大幅缩短推理冷启动时间

    Amazon SageMaker HyperPod 引入了一项模型缓存功能,旨在显著减少推理冷启动时间。此新功能将模型权重和容器镜像预加载到集群节点上,使 Pod 能够从本地 NVMe 存储高速访问数据,而不是依赖于较慢的网络下载。因此,推理 Pod 可以在几秒钟内开始提供流量,而不是之前所需的几十分钟,从而提高了自动扩展的响应速度。

  19. TOOL · CL_245153 ·

    新的FATS攻击利用LLM,GPT-4.1和DeepSeek-R1极易受攻击

    研究人员开发了一种名为FATS(Feign Agent Attack with Toxic-shots)的新型提示注入攻击,该攻击利用了大型语言模型(LLM)的漏洞。这种攻击方法通过混淆偏好提取和破坏毒性样本来操纵LLM,导致其生成有害输出。实验表明,GPT-4.1和DeepSeek-R1等知名模型极易受到FATS攻击,这凸显了仔细分析与安全相关的训练数据以构建更安全的LLM的必要性。

  20. TOOL · CL_245035 ·

    新框架评估用于工业 4.0 的 LLM 生成的资产管理壳

    研究人员开发了一个新框架来评估大型语言模型 (LLM) 生成的资产管理壳 (AAS) 的质量。该方法系统地降低 AAS 生成的质量,以评估不同指标在反映质量变化方面的效果,从而应对制造业工业 4.0 转型中人工智能生成 AAS 的质量保证挑战。研究发现,专注于属性名称精确匹配和基于相似度的属性值软匹配的指标,特别是基于值的召回率和基于名称的 F1 分数,是质量下降最可靠的指标。这些发现旨在帮助选择合适的指标、调整 LLM 管道以及将人…