PulseAugur
实时 23:46:35
实体 DeepSeek-V3

DeepSeek-V3

PulseAugur coverage of DeepSeek-V3 — every cluster mentioning DeepSeek-V3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
29
90 天内 98
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

20 天有情绪数据

最近 · 第 1/5 页 · 共 98 条
  1. TOOL · CL_212393 ·

    DeepSeek V3 在独立基准测试中每美元实现28.8的智能点数

    独立基准测试显示,DeepSeek V3 在2024年12月每美元实现了28.8的智能点数。这一指标突出了模型的效率和性能,区别于自我报告的数据。

  2. TOOL · CL_210932 ·

    AirLLM 大幅降低 LLM 内存需求,Kimi K3 可在 4GB GPU 上运行

    AirLLM 发布了更新,显著降低了运行大型语言模型的内存需求,使得强大的模型能够在消费级硬件上运行。最新支持的模型包括 Qwen3.8-27B,仅需 3.33GB 的 VRAM;以及 Kimi K3 (2.8T),这是迄今为止最大的开源模型,可在 4GB 以下的 VRAM 上运行。这些进步是通过每专家流式传输等技术实现的,例如,DeepSeek-V3 (671B) 模型可在约 12GB 的 VRAM 上运行。

  3. TOOL · CL_206165 ·

    GenAI模型在OOP评估中表现优于学生,但在高级概念方面仍有困难

    一项发表在arXiv上的新研究评估了五种领先的生成式AI系统在入门面向对象编程评估中的表现,包括ChatGPT 5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5和M365 Copilot。研究发现,所有评估的AI模型都显著优于平均学生群体,在复杂的编码任务中经常获得满分。然而,这些模型仍然存在局限性,偶尔会生成无法编译的代码,并且在抽象类和某些继承场景等高级面向对象概念以及图形相关问…

  4. TOOL · CL_205952 ·

    LLM文本到SQL基准按自主性轴分析 · 跟踪到1个来源

    一篇新论文重新审视了LLM文本到SQL领域,提出了一种基于自主性的分类法和经验基准分析。作者收集了报告的指标,并沿着推理自主性轴进行组织,涵盖了受限、上下文内、迭代、Agentic和推理内化生成。他们对Spider基准进行的案例研究比较了各种开源模型(有无思维链监督)与既有基线,结果表明自主性增加是有代价的,并且思维链监督主要使更复杂的查询受益。

  5. TOOL · CL_205491 ·

    LLM 工具 llmfit 增加众包硬件验证

    命令行工具 llmfit 帮助用户确定大型语言模型是否能在其硬件上运行,现已推出众包功能。llmfit 不再仅依赖自身的估算,而是让用户在实际机器上验证模型的兼容性和性能。此次更新还增加了对 Qwen3.5 系列模型以及 Ollama 和 llama.cpp 等各种 LLM 后端的改进自动发现的支持。

  6. TOOL · CL_203973 ·

    新的DeaMoE架构提升LLM解码效率

    研究人员推出了一种新颖的混合专家(MoE)架构DeaMoE,旨在提高大型语言模型(LLM)的解码效率,尤其是在小批量场景下。这种新结构将专家分组到部门中,允许部门内的参数共享,同时保留单个专家的独特参数。DeaMoE采用两阶段路由策略,以最大限度地减少冗余专家加载,从而显著提高解码速度并减少内存使用。实验表明,DeaMoE可以将加载的权重减少高达50.9%,并在NVIDIA H100 GPU上实现高达2.00倍的速度提升。

  7. TOOL · CL_200129 ·

    研究发现:大型语言模型在说服力方面超越人类

    一项新的研究论文探讨了大型语言模型(LLM)与人类相比的说服能力。研究发现,像Claude 3.5 Sonnet这样的大型语言模型在说服力方面可以超越受激励的人类,尤其是在提高准确性的真实说服场景中。然而,与人类说服者不同的是,大型语言模型的说服优势在重复互动中会减弱。研究还指出,DeepSeek v3在欺骗性环境中表现出更强的说服力,这表明模型在说服能力方面存在差异。

  8. TOOL · CL_200043 ·

    TEMPO调度器通过考虑内存和计算约束来优化MoE服务

    研究人员开发了TEMPO,一种新颖的感知时界调度器,旨在优化专家并行(EP)混合专家(MoE)模型的服务。与假设专家时间线性扩展的先前方法不同,TEMPO考虑了两种不同的约束:内存约束(HBM权重流)和计算约束(分组GEMM轮)。该系统将每个批次的调度形式化为一个固定成本时界问题,并高效地解决它以提高吞吐量并降低延迟,特别是在两种约束同时存在的情况下。

  9. SIGNIFICANT · CL_198888 ·

    DeepSeek V4 Pro 和 Grok 4.6 模型出现,定价趋于稳定 · 跟踪到 1 个来源

    两款新的大型语言模型 DeepSeek V4 Pro 和 Grok 4.6 已被识别,于 8 月 13 日出现。DeepSeek V4 Pro 被定位为其 V3 系列的升级版,预计定价具有竞争力,但具体的基准测试和上下文窗口细节仍有待公布。Grok 4.6 是 Grok 4 的渐进式更新,可能为现有用户提供细微的功能增强或调整费率限制。

  10. TOOL · CL_189821 ·

    Yingsuan AI通过统一网关简化DeepSeek API访问

    Yingsuan AI推出了一款统一网关,旨在简化对包括DeepSeek产品在内的各种大型语言模型的访问。该平台允许开发者使用单一API密钥和兼容OpenAI的SDK与DeepSeek-V3和DeepSeek-R1等模型以及GPT和Claude等其他模型进行交互。该服务旨在减少管理多个API端点和身份验证方法的摩擦,并提供免费套餐供初步测试和原型设计。

  11. TOOL · CL_189571 ·

    TokenRouter 集成 Tauric Research TradingAgents 以访问 LLM

    本指南详细介绍了如何将 TokenRouter 与 Tauric Research 的 TradingAgents 框架集成。此次集成允许用户通过 TradingAgents CLI 中的 TokenRouter API 选择各种 LLM,包括来自 OpenAI、Anthropic 和 DeepSeek 的模型。该过程涉及在目录中定义 TokenRouter 模型、注册其 API 端点、配置 API 密钥以及调整验证设置以支持任意模型名称。

  12. TOOL · CL_189458 ·

    AI抄袭检测器无法识别AI生成文本,法院裁定不应依赖有缺陷的工具

    最近对“Antiplagiat.VUZ”系统的测试显示,该系统未能检测出三种不同LLM生成的文本,将其评定为98%以上原创。这与“Antiplagiat”公司声称其更新后的系统能以98%的准确率检测AI的说法相矛盾。文章解释说,像分词和向量相似性这样的常见抄袭检测方法,很容易被AI欺骗或误解人类写作。最近,鞑靼斯坦法院裁定,仅凭“Antiplagiat.VUZ”结果而开除一名学生是非法的,这凸显了此类工具的不可靠性。

  13. TOOL · CL_187348 ·

    大型语言模型能模拟出合理的患者,但无法代表真实人群

    arXiv上发表的一项新研究表明,大型语言模型在被要求模拟心理健康患者时,能够生成个体上合理的病例,但无法代表真实的人群。研究人员测试了GPT-4o mini、Gemini 3 Flash、DeepSeek-V3和GLM-4.7等模型根据人口群体生成患者档案的能力。虽然个体患者模拟在很大程度上符合诊断标准,但聚合后的人群却显示出显著的偏差,包括症状评分虚高、人口统计学差异扭曲以及患者数据再生不稳定。研究人员将这种差异称为“连贯性-保真度分离”。

  14. COMMENTARY · CL_186003 ·

    人工智能在诗歌等创意任务上表现出色,但在卡路里计算方面存在事实准确性问题

    人工智能模型在需要事实准确性的任务中被证明是不可靠的,例如从照片计算卡路里,流行的应用程序在这方面持续低估摄入量。然而,人工智能在创意和主观领域更为成功,例如模仿经典作家风格生成诗歌,因为版权法保护特定作品而非风格元素。虽然人工智能可以模仿风格,但质量因模型而异,需要用户测试,provod.ai 等平台提供对多个模型的访问以供比较。

  15. TOOL · CL_183304 ·

    心理健康AI安全性:专用系统在真实世界审计中表现优于前沿模型

    一项发表在arXiv上的新研究通过使用模拟基准和真实对话,评估了六个前沿通用模型与一个专用系统在心理健康AI安全性方面的表现。与OpenAI的GPT-5系列、DeepSeek-V3、Google Gemini 3 Flash和Moonshot Kimi K2等模型相比,该专用AI在有害内容方面,尤其是在自杀、自残、饮食失调和药物滥用方面,表现出显著更低的发生率。对20,000次部署对话的审计证实了该专用系统在提供危机资源方面的有效性,…

  16. TOOL · CL_182202 ·

    Cursor 发布开源 MoE 训练超级内核 Mixture-of-Kittens

    Cursor Research 已开源 Mixture-of-Kittens (MoK),这是一个专为 Mixture-of-Experts (MoE) 模型设计的专用训练内核。该超级内核将 MoE 通信和计算融合为单一的确定性过程,据称与现有基线相比,吞吐量提高了 2.37 倍。MoK 针对 NVIDIA GB200 NVL72 机架等高端硬件进行了优化,适用于大规模 AI 模型开发和训练。

  17. TOOL · CL_181992 ·

    AI文本模型质量相近但生成俄语内容价格相差130倍

    一项对18款AI模型生成俄语文本的最新独立测试显示,尽管GPT-5.4和Claude Opus 4.6等顶级模型的表现几乎相同,但它们的价格却相差130倍。这种显著的成本差异,每次调用费用从0.0008美元到0.1014美元不等,表明经济因素应在内容创作者选择模型时发挥重要作用。测试还突出了俄语文本生成中的具体问题,例如插入非西里尔字母字符以及提示泄露到输出中,这些问题可以通过简单的脚本来缓解。然而,一种更微妙的AI生成文本形式,其特…

  18. RESEARCH · CL_178781 ·

    据报道,中国正在提取美国AI模型用于军事用途

    据报道,中国军方研究人员使用一种称为“知识蒸馏”的技术,从OpenAI和Anthropic等先进的美国AI模型中提取能力。这个过程允许他们训练更小、更具成本效益的国内AI模型,用于军事和公共安全应用,可能绕过美国的出口限制。虽然一些中国AI公司否认使用蒸馏技术来开发他们的模型,例如Moonshot AI的Kimi K3,但美国官员和智库(如詹姆斯敦基金会)认为这种做法很普遍,甚至可能绕过内置的安全措施。

  19. TOOL · CL_174540 ·

    AI代理通过新的记忆系统从错误中学习,提高准确性

    研究人员开发了RSMeM,一种用于遥感AI代理的新型记忆系统,增强了它们从错误中学习的能力。据报道,该系统在仅将令牌使用量增加不到1%的情况下,将DeepSeek-V3的准确率提高了6%。研究结果已发布在arXiv上。

  20. SIGNIFICANT · CL_173137 ·

    Moonshot 的 Kimi K3 在前沿人工智能模型中排名第四

    Moonshot 的 Kimi K3 是一款开放权重模型,已达到前沿水平,在 Artificial Analysis 的 580 个模型中排名第四。它仅次于 Claude Opus 5、Fable 5 和 GPT-5.6 Sol。该模型的技术报告强调了诸如 Kimi Delta Attention(用于高效上下文处理)、Quantile Balancing(确保专家均衡加载)以及 AgentENV(通过快速沙盒检查点和恢复来优化 RL…