PulseAugur
实时 10:32:18
实体 C4 model

C4 model

PulseAugur coverage of C4 model — every cluster mentioning C4 model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 16
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 16 条
  1. TOOL · CL_191163 ·

    WorldMark系统通过知识接口增强LLM水印

    研究人员推出了一种新颖的接口WorldMark,旨在增强大型语言模型生成文本的水印鲁棒性。该系统利用世界知识记忆(WKM)来组织语义和情景知识,并将其转换为令牌级知识显著性分数。该分数通过不对称知识调制(AKM)来调节主机水印的强度,从而在无需骨干网络重新训练或额外检测器模型的情况下提高检测率。WorldMark已在C4数据集上针对各种自适应强度主机变体证明了其在水印检测方面的改进,且开销可忽略不计。

  2. RESEARCH · CL_191102 ·

    新的 C4 框架使用中国成语评估多模态大语言模型的创造力 · 跟踪 2 个来源

    研究人员推出 C4,这是一个旨在评估多模态大语言模型 (MLLMs) 跨概念创造力的新评估框架。该框架利用中国成语(Chengyu)来测试模型从非显而易见的关联中理解和生成含义的能力。C4 评估集 (C4-Eval) 包括合成和人类创建的项目,目前的评估表明,最强的闭源 MLLMs 的准确率约为 50%,而开源模型的表现则显著较低,这凸显了当前 MLLMs 在创造性解读能力方面存在的差距。

  3. TOOL · CL_160805 ·

    新型扩散模型可从CBCT扫描合成高质量CT图像

    研究人员开发了一种新颖的基于扩散的条件生成模型,名为EqDiff-CT,旨在从锥束CT(CBCT)扫描合成高质量计算机断层扫描(CT)图像。该模型采用具有组等变条件U-Net骨干的去噪扩散概率模型(DDPM),并结合e2cnn可操纵层来强制执行旋转等变性和循环C4对称性。在SynthRAD2025数据集上进行测试,与CycleGAN和DDPM等现有方法相比,EqDiff-CT在结构保真度、亨斯菲尔德单位准确性和整体定量指标方面均有显著…

  4. TOOL · CL_158526 ·

    新的 Spectral-LSH 方法可高效压缩 LLM 提示

    研究人员开发了 Spectral-LSH,一种新颖的无需训练的方法,用于压缩语言模型的长提示,解决了预填充注意力中的二次方扩展问题。该技术使用 Krylov 子空间方法和随机特征来近似注意力核算子,然后采用 SimHash 将相似的 token 分组为宏 token。在 Mistral-7B-Instruct-v0.3 和 Qwen2.5 模型上的评估表明,Spectral-LSH 在更高级别的压缩比(8 倍和 16 倍)下能有效保持…

  5. TOOL · CL_122974 ·

    新方法使用通用文本语料库剪枝MoE语言模型

    研究人员开发了一种名为Generic TB-Coverage的新方法,用于剪枝稀疏激活的专家混合(MoE)语言模型。该技术解决了在无需特定下游校准数据的情况下移除冗余专家的挑战。通过利用WikiText2和C4等通用文本语料库,Generic TB-Coverage分别在每个语料库上分析每个专家的效用,并确保保留每个语料库中的高效用专家。这种方法在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base等模型上,…

  6. TOOL · CL_127620 ·

    新的MoE剪枝方法使用通用数据来保留专家效用

    研究人员开发了一种名为 Generic TB-Coverage 的新方法,用于剪枝稀疏激活的混合专家(MoE)语言模型。该方法使用 WikiText2 和 C4 等通用文本语料库进行校准,这与依赖单一聚合重要性分数的现有方法不同。通过在每个语料库上单独分析每个专家的效用,并强制执行基于预算的覆盖规则,Generic TB-Coverage 在创建最终剪枝掩码之前保留了高效用专家。在 Qwen1.5-MoE-A2.7B 和 DeepSe…

  7. TOOL · CL_121087 ·

    新的网络架构将双曲几何与对称群相结合,以改进视觉表示学习

    研究人员开发了群等变庞加莱卷积网络(Group-Equivariant Poincaré Convolutional Networks),这是一种在双曲空间中学习视觉表示的新方法。该方法通过整合离散对称群($C_4$ 和 $D_4$)来改进优化并减少冗余参数使用,从而解决了现有双曲网络的局限性。提出的技术,包括几何安全的张量重塑和双曲群卷积,加速了收敛并更好地遵循庞加莱球流形的约束。

  8. TOOL · CL_119107 ·

    小红书启动秘密项目;Nutrabolt 寻求 10 亿美元 IPO;Codex 推出硬件

    据报道,小红书已启动一项名为 Darwin Ai 的秘密内部项目,旨在开发一款与现有平台相媲美的新产品。该计划对内部员工开放,核心高管领导团队并提供资源。成功的参与者可能领导新产品,起步级别可能为 L1。另外,能量饮料公司 Nutrabolt 据报道正准备进行可能价值 10 亿美元的 IPO,并与摩根大通和高盛等主要银行合作。此外,Codex 揭示了其首款硬件产品,OpenClaw 和 Cursor 正携代理设备进入移动市场。

  9. COMMENTARY · CL_104305 ·

    自然语言漂移在代理软件开发中持续存在

    自然语言虽然容易发生漂移,但仍然是软件开发的关键组成部分,尤其是在表达用户意图和反馈方面。代理代码生成虽然直接执行这些自然语言指令,但并未消除漂移,反而使其可执行。开发记号的正式程度与技术和业务利益相关者之间的协作潜力成反比,高度正式的记号为非技术人员的参与留下的空间更少。在业务关键决策仍以自然语言表达的领域,为 AI 代理的解释和行动提供了最大的自由度。

  10. TOOL · CL_98129 ·

    New signature filtering method boosts LLM watermark detection accuracy

    研究人员开发了一种名为签名过滤的新方法,以改进大型语言模型中统计水印的检测。该技术在不改变嵌入或生成过程的情况下增强了现有的水印检测。通过识别和移除可能干扰检测的特定“签名”标记,该方法显著提高了准确性,尤其是在信号较弱或文本重复的情况下。该方法在各种大型语言模型和数据集上都表现出高检测率,即使在句子打乱和标记扰动等挑战性条件下也是如此。

  11. TOOL · CL_90556 ·

    FineWeb 数据集:网络语料库分析实践教程

    本教程提供了关于使用 FineWeb 数据集(一个大规模网络语料库)的实践指南。它演示了如何流式处理和分析数据集样本,包括使用 GPT-2 分词器等工具进行过滤、去重和分词。该指南还涵盖了分析 URL、语言和词元计数等元数据,以及实现类似于 C4 等数据集所用质量过滤流程。

  12. TOOL · CL_68354 ·

    LLM剪枝面临能力权衡;新方法提高保留率

    研究人员发现,在剪枝大型语言模型时存在一种权衡:用于提高通用能力的校准数据可能会损害在编码和数学等专业任务上的性能。为解决此问题,他们提出了一种多源校准混合技术和一个名为IGSP的自动化协议。与单源校准相比,该方法显著提高了整体模型保留率,尤其是在高稀疏度水平下。

  13. TOOL · CL_66071 ·

    新的BLISS方法通过高效的数据选择加速LLM预训练

    研究人员开发了BLISS,一种用于更高效地预训练大型语言模型的数据选择新方法。与以前的方法不同,BLISS不需要外部预训练模型,并且通过使用代理模型和评分模型来考虑数据的长期影响。这种双层优化方法允许BLISS预测训练样本的影响得分,从而实现高质量数据的选择。使用Pythia和LLaMA模型进行的实验表明,与最先进的方法相比,BLISS在达到目标性能方面实现了1.7倍的加速。

  14. TOOL · CL_51068 ·

    AI研究将激活稀疏性与损失平面性联系起来

    研究人员在理论上将Transformer MLP中的激活稀疏性与其损失平面的平坦度联系起来。他们提出,这种可以降低计算成本的稀疏性受到涉及“增强平坦度”以及输入/梯度范数的比率的影响。该研究还引入了“导数稀疏性”作为一种更稳定的替代方法,有助于反向传播剪枝。在ImageNet-1K和C4上的实验表明,与标准Transformer相比,训练和推理稀疏性都有显著提高。

  15. RESEARCH · CL_10117 ·

    AdaFRUGAL论文介绍了用于内存高效LLM训练的动态控制

    研究人员开发了AdaFRUGAL,一个旨在提高大型语言模型(LLM)训练内存效率的新框架。与之前需要手动调整超参数的方法不同,AdaFRUGAL使用动态控制来自动化这一过程。它采用子空间比率的线性衰减和用于更新频率的感知损失调度,已被证明可以在减少GPU内存和训练时间的同时保持具有竞争力的性能。

  16. RESEARCH · CL_01207 ·

    Google Cloud C4、英特尔和 Hugging Face 合作,GPT 开源模型 TCO 提升 70%

    Google Cloud 的 C4 平台与英特尔和 Hugging Face 合作,在运行开源 GPT 模型方面实现了 70% 的总拥有成本 (TCO) 显著提升。通过使用英特尔至强处理器,这种优化得以实现,从而能够更高效、更经济地部署大型语言模型。该举措旨在让更广泛的用户和组织能够更轻松、更实惠地使用强大的 AI 模型。