PulseAugur
中
实时 11:18:48
实体 scale

scale

PulseAugur coverage of scale — every cluster mentioning scale across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
25
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_273481 ·

    新方法无需多注释者标签即可改进病理模型校准

    研究人员开发了一种名为合成协议校准的新方法,用于改进计算病理学中使用的基础模型的校准。该技术解决了模型可能对其疑难病例的预测过于自信的问题,即使平均准确率尚可。通过使用训练好的线性探针并在类别锚点之间进行插值,该方法创建了一种诊断模糊性的合成度量。这使得能够使用协议感知的标签平滑来重新训练探针,从而在无需多注释者标签的情况下增强校准,并保持判别指标。

  2. TOOL · CL_268731 ·

    AI 辅导系统 DeepEdu-v1 在越南教育领域推出

    研究人员开发了 DeepEdu-v1,这是一个专为越南教育设计的 AI 辅导系统,解决了数据主权和本地内容方面的挑战。与 ChatGPT 等基于云的模型不同,DeepEdu-v1 将数据保留在本地,以遵守越南 53 号法令等法规。该系统利用了一个名为 SCALE 的新颖框架,该框架具有高效的长上下文推理引擎,可减少检索调用和预填充延迟,以及一个代理层,该代理层可整理交互中的知识,以最大限度地减少对主导语言先验的依赖。

  3. TOOL · CL_280937 ·

    新的SCALE方法通过控制特征使用来增强SFT

    研究人员推出了一种名为SCALE(Selective Control of Adaptation via Local Entropy,通过局部熵选择性控制适应)的新型监督微调(SFT)方法,旨在通过控制学习到的特征的使用方式来改进模型适应性。与专注于抑制或放大更新的现有方法不同,SCALE冻结了预训练模型和SFT增量,学习门控机制,根据熵减少来抑制、反转或外推特征。这种方法在多个Qwen模型(包括Qwen2.5-Math-1.5B、Q…

  4. COMMENTARY · CL_258429 ·

    Together AI 概述迁移到开源模型的策略

    Together AI 的博客文章概述了从闭源迁移到开源 AI 模型的策略,强调此类迁移可以比传统迁移更快、更简单,尤其是在利用托管服务时。该过程涉及定义特定的用例和工作负载,以识别相关的基准和候选模型。关键评估标准不仅包括排行榜上的原始性能指标,还包括每项任务的成本、令牌使用量、运行时以及验证正确答案的能力。文章还强调了在沙盒环境中进行实际测试以评估模型行为和故障模式的重要性。

  5. TOOL · CL_231492 ·

    新型AI模型可从非配对数据预测细胞反应

    研究人员开发了SCALE,这是一种新颖的条件传输模型,旨在预测细胞对扰动的反应。与先前需要配对的对照组和处理过的细胞群的方法不同,SCALE可以从非配对数据中学习扰动特异性效应。该模型利用共享的集合感知编码器和条件扩散Transformer骨干网络来预测处理过的细胞群,在各种遗传、化学、发育和免疫扰动中均显示出有效性。在CRISPR数据的实验中,SCALE在预测基因表达变化和反应方向方面优于现有方法,并成功地优先确定了可能引起不同免疫…

  6. SIGNIFICANT · CL_230602 ·

    AfterQuery 成为 YC 最快独角兽,估值达 32 亿美元

    AI 训练数据初创公司 AfterQuery 已达到独角兽地位,估值 32 亿美元,成为 Y Combinator 历史上最快达到此里程碑的公司。此次快速崛起发生在公司 A 轮融资估值 3 亿美元仅五个月后,凸显了公司对 AI 模型人类推理数据的关注。AfterQuery 雇佣专业人士训练 AI 进行决策和任务完成,这使其区别于仅关注准确性的竞争对手。

  7. SIGNIFICANT · CL_215362 ·

    Harvey Tenet:新型法律代理模型利用Kimi K3和Fireworks

    Harvey发布了Harvey Tenet,这是一款专为长时法律任务设计的新研究预览模型。该模型基于Kimi K3基础模型,并通过使用Fireworks进行异步强化学习进行增强,其训练语料库包括合成数据、公开法律数据和专家数据。在法律基准测试中,Harvey Tenet相比其基础模型有了显著改进,在LAB: Contracts上取得了最先进的成果,并在更广泛的Harvey's Legal Agent Benchmark (LAB)上表…

  8. RESEARCH · CL_212295 ·

    NVIDIA 以独特的许可协议聘用 109 名 Poolside AI 员工

    Poolside,一家以其 AI 模型工厂而闻名的公司,在 NVIDIA 和其创始人 Jensen Huang 的参与下发生了重大转变。与传统的收购不同,NVIDIA 获得了 Poolside 的技术许可,并聘用了其 109 名员工,为创始人及员工提供了巨额报酬。此前 Poolside 未能获得 20 亿美元的融资,以购买用于大型 GB300 GPU 集群,这凸显了开发前沿 AI 模型所需的巨额资本和基础设施。该公司创始人正在转向新的…

  9. TOOL · CL_206419 ·

    新的SCALE方法通过改进潜在空间几何结构来增强AI规划能力

    研究人员开发了一种新方法SCALE(State-Calibrated Latent Embeddings),用于改进联合嵌入预测世界模型中的规划。SCALE通过将成对潜在距离与标准化状态空间距离相关联,来增强潜在表征的几何特性,类似于DINO-WM中发现的特性。这种方法在训练过程中作为一种轻量级正则化器应用,与LeWorldModel等现有方法相比,在各种任务、规划求解器和计算预算上都显示出了一致的改进。研究结果表明,潜在空间的几何结…

  10. RESEARCH · CL_191225 ·

    新框架利用LLM和嵌入来扩展科学分类法 · 已追踪2个来源

    两篇新的研究论文介绍的框架利用大型语言模型(LLM)和嵌入来增强科学分类法。第一个框架ReLTEx,通过结合LLM生成和结构感知验证,专注于可靠的基于LLM的分类法扩展,以减少幻觉并提高一致性。第二个框架SCALE,通过使用嵌入和LLM创建新的科学概念层来扩展OpenAlex分类法,将语义相关的术语组织成连贯的单元,从而实现更细粒度的学术分类和分析。

  11. TOOL · CL_165183 ·

    新 AI 框架解决半导体设计规则违规问题

    研究人员开发了 SCALE,一个旨在解决先进亚 2 纳米节点半导体制造中复杂设计规则违规的新框架。该系统采用自监督布局生成阶段,其中经过微调的语言模型学习从周围环境中重建被掩码的多边形。这种方法使模型能够生成带有 DRC 注释的布局违规对,然后用于微调领域适应的视觉语言模型 (VLM)。该 VLM 为局部 DRV 修复提供规则感知的几何指导,在真实案例中将最先进代理的解决率提高了高达 25%。

  12. COMMENTARY · CL_161789 ·

    AI模型质量从规模转向嵌入式推理

    AI模型质量完全依赖于规模的时代正在结束。未来的进步将侧重于将推理直接嵌入模型权重,而不是依赖草稿本或复杂提示等外部工具。这种方法有望提高复杂任务的效率和一致性。

  13. RESEARCH · CL_156357 ·

    ConceptCF 方法增强了时间序列数据的 AI 可解释性

    研究人员推出了一种名为 ConceptCF 的新方法,用于为时间序列数据生成反事实解释。该方法侧重于修改数据中人类可理解的概念,而不是单个点或子序列,以增强 AI 模型在医疗保健和预测性维护等关键领域的解释能力。通过将时间序列分解为诸如尺度和频带等概念,ConceptCF 使用遗传算法创建更有意义和可理解的反事实。评估表明,ConceptCF 在解释质量的关键指标上优于五种现有方法。

  14. RESEARCH · CL_156455 ·

    新的 GAMUT 基准测试 AI 事实完整性,Gemini 3.1 Pro 领先

    研究人员开发了 GAMUT,这是一个旨在评估长文本 AI 生成内容事实完整性的新基准。与以往关注单个声明准确性的方法不同,GAMUT 评估响应是否包含所有必要信息,解决了“事实性的缺失一半”。该基准利用了一个两级元评分标准系统,该系统可以机械地编译成机器可评分的清单,即使使用 LLM 裁判也证明是有效的。在评估中,GAMUT 对 14 个前沿和开源模型提出了重大挑战,谷歌的 Gemini 3.1 Pro 取得了 58.7% 的最高分。

  15. COMMENTARY · CL_132060 ·

    风险投资家揭示发现独角兽公司创始人的38点框架

    风险投资家Paige和Leura Craig开发了一个38点框架,用于识别潜在的独角兽公司创始人,重点关注决策能力(在混乱中)、韧性和非理性乐观等特质。他们的方​​法借鉴了Paige的军事背景以及在SpaceX和Gusto等公司的经验,强调性格和执行力而非传统指标。该框架涉及广泛的访谈,旨在在压力下引发创始人真实的行为,以期为评估创业卓越性提供一个共同的词汇。

  16. SIGNIFICANT · CL_126812 ·

    Anthropic 的 Claude Fable 5 在复杂任务上表现出色,在远程劳动力指数中获得 16.1%

    Anthropic 的 Claude Fable 5 模型在远程劳动力指数(Remote Labor Index)中获得了 16.1% 的分数,该指数旨在评估 AI 执行自由职业计算机工作的能力。据报道,这一表现是次优模型的两倍,凸显了 Fable 5 在需要多步骤和判断的长周期任务中的优势。建议用户将 Fable 5 视为处理复杂工作的资源,而不是简单的聊天机器人任务,并建议在 Fable 参与关键规划或执行阶段之前,先使用更便宜的…

  17. TOOL · CL_129605 ·

    新的SCALE框架增强了异构机器人车队的协调能力

    一个名为SCALE的新框架已被开发出来,用于解决工业环境中异构机器人车队的协调挑战。该框架通过引入一种用于在线路径生成和冲突解决的运动诱导冲突减少机制,将实时规划与鲁棒执行相结合。为了处理干扰和偏离规划路径的情况,SCALE采用了一种广义的共轭动作-优先超图(CAPH),该超图能够自适应地调整机器人优先关系。SCALE的有效性已通过广泛的实验和一个为期三天的仓库部署得到证明。

  18. TOOL · CL_121237 ·

    新框架SCALE增强了工业环境中机器人车队的协调能力

    一篇新研究论文介绍了一种名为SCALE的反应式在线协调框架,旨在提高工业环境中异构机器人车队的效率。该框架解决了密集、多样化机器人种群的实时路径规划挑战,并缓解了通信延迟和执行不确定性引起的问题。SCALE包含一个用于在线路径生成和冲突解决的运动诱导冲突减少机制,以及一个通用的共轭动作-优先超图(CAPH)来适应性地管理机器人交互。

  19. TOOL · CL_116560 ·

    适用于 AMD GPU 的 CUDA 模拟器 Zluda 失去资金支持,回归爱好状态

    Zluda 项目是一个在 AMD GPU 上模拟 NVIDIA CUDA 的开源项目,现已失去商业资金支持并回归爱好状态。尽管面临挫折,Zluda 的第 6 版引入了新功能,包括对 32 位 PhysX 的预 Alpha 支持、改进的 Windows 兼容性以及对 PyTorch 集成的增强。虽然 Zluda 之前曾获得 AMD 和一家未披露的 AI 公司的支持,但其未来的开发现在完全依赖于其首席开发者的热情。

  20. COMMENTARY · CL_105787 ·

    Anthropic 的 Claude 代码负责人:递归代理是编码的下一个时代

    Anthropic 的 Claude 代码负责人 Boris Cherny 在 Meta 的 @Scale 会议上讨论了编码的未来。他强调递归代理循环是下一个重大发展,并将其描述为能够提交拉取请求的、持续自我改进的子代理。Cherny 指出,令牌成本仍然是这项技术的主要限制因素。