PulseAugur
实时 08:25:35
实体 SciCode

SciCode

PulseAugur coverage of SciCode — every cluster mentioning SciCode across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. COMMENTARY · CL_213543 ·

    Reddit讨论显示,AI模型在科学编码基准测试中接近饱和

    Reddit的r/singularity论坛上的一个讨论探讨了AI模型在科学编码基准测试(特别是SciCode、HLE和CritPt)上的饱和点。分析表明,虽然HLE和CritPt的月度改进率分别约为2.6%和2.3%,但SciCode的进展速度明显较慢,约为每月1.2%。讨论强调了即使是GPT 5.6和Claude Fable 5等先进模型在SciCode上的表现似乎也已达到平台期。

  2. TOOL · CL_203015 ·

    Sarvam 30B 模型性能指标在基准测试中公布

    Sarvam AI 发布了其 Sarvam 30B 模型,目前已公布多个基准测试的性能指标。该模型在 GPQA 上达到 63.3%,在 Humanity's Last Exam 上达到 7.5%,在 SciCode 上达到 19.2%。值得注意的是,它在长上下文推理任务上得分为 0%,并且其成本效益以每美元 136.2 智能点突出显示。

  3. RESEARCH · CL_201933 ·

    Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源

    独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。

  4. SIGNIFICANT · CL_187043 ·

    Meta 的 Muse Spark 1.2 展现出快速的性能提升,可与顶级 AI 模型相媲美

    Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后…

  5. COMMENTARY · CL_186090 ·

    Gemma 4 在 SciCode 基准测试中排名靠前引发用户质疑

    Reddit 的 r/LocalLLaMA 社区的一名用户质疑 artificialanalysis.ai 报告的 Gemma 4 在 SciCode 基准测试中的排名高于 Qwen-3.6 27B。该用户表示惊讶,称该排名与其在编码任务中对这些模型的实际使用经验相悖。他们推测 Gemma 4 是否真的如此精通,或者基准测试本身是否存在问题。

  6. TOOL · CL_167273 ·

    新方法通过整合经验增强LLM科学计算能力

    研究人员开发了一种名为SciConsolidate的新方法,以提高大型语言模型(LLM)的科学计算能力。该技术将解决问题的运行时经验转化为可转移的程序性知识,解决了特定修复可能无法泛化以及较弱模型难以执行抽象程序的问题。通过分析成功和失败的案例,SciConsolidate诱导出跨任务程序,并使用基于失败的查询合成来扩展训练数据。将其应用于Qwen3.6-27B后,其在科学计算任务上的性能有所提高,而较小的Qwen3.5-9B模型在程…

  7. RESEARCH · CL_161409 ·

    LLM基准测试结果揭示多个模型的性能 · 追踪9个来源

    一项最近的独立基准评估揭示了包括Kimi K2、Sarvam Maya、NVIDIA Nemotron 3 Super 120B、DeepSeek V3.2、Falcon H1R-7B、GLM-5.2、GLM-5.1、Solar Open 100B和GLM-4.7-Flash在内的多个大型语言模型的性能指标。基准测试涵盖了推理、MMLU-Pro、人类最后考试和长上下文推理等领域,不同模型的结果差异显著。值得注意的是,GLM-5.2和D…

  8. RESEARCH · CL_137517 ·

    开源大模型在多项指标上表现强劲 · 追踪 4 个来源

    根据独立测量结果,几款开源人工智能模型在各种基准测试中表现强劲。Mi:dm K 2.5 Pro 在 GPQA 上达到 70.1%,在 MMLU-Pro 上达到 80.9%;MiMo-V2-Flash 在 GPQA 上达到 83.5%,在 Humanity's Last Exam 上达到 20%;Qwen3.5 122B A10B 在 GPQA 上达到 85.7%,在 Humanity's Last Exam 上达到 23.4%;Apr…

  9. RESEARCH · CL_65553 ·

    AI研究引入新的基准演化和智能体自我重构方法

    两篇新研究论文介绍了推进AI能力的新颖方法。BenchEvolver 专注于通过演化现有问题来创建更具挑战性的编码基准,旨在克服基准饱和并改进模型训练。ToolSelf 提出了一种用于LLM智能体的运行时自我重构范式,允许它们在任务执行期间动态调整其工具和策略,以增强泛化能力和性能。

  10. RESEARCH · CL_61375 ·

    NVIDIA 量化 Alibaba 的 Qwen3.6-35B 模型以实现高效部署

    NVIDIA 发布了 Alibaba 的 Qwen3.6-35B-A3B 模型的量化版本,命名为 nvidia/Qwen3.6-35B-A3B-NVFP4。该模型使用 NVFP4 数据类型,将内存需求减少约 3.06 倍,同时在各种基准测试中保持了有竞争力的性能。它针对 AI 代理系统、聊天机器人和 RAG 系统进行了优化部署,并已准备好商用。

  11. RESEARCH · CL_06981 ·

    无测试用例,亦无妨:面向科学工作流的蒸馏驱动代码生成

    研究人员开发了MOSAIC,一个新颖的框架,用于在不依赖传统输入/输出测试用例的情况下生成科学工作流的代码。这种新方法利用知识蒸馏技术,其中一个较小的“学生”模型从一个较大的“教师”模型那里学习,并以领域特定的示例和问题分解为基础。为了确保多步骤推理的一致性,MOSAIC采用了集成的上下文窗口。在SciCode基准上的实验表明,即使使用能力较弱的模型,MOSAIC也能提高准确性和数值精度。