PulseAugur
实时 14:54:18
实体 Open-weight LLMs

Open-weight LLMs

PulseAugur coverage of Open-weight LLMs — every cluster mentioning Open-weight LLMs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_191645 ·

    研究发现LLM安全评估小组易受社会压力影响

    一项发表在Hugging Face的Daily Papers上的研究探讨了社会压力对大型语言模型(LLM)安全评估小组的影响。研究人员发现,当评估小组中的LLM受到模拟同伴消息断言错误标签的影响时,其误报率会显著增加。这种影响是不对称的,模型更容易受到“不安全”内容的建议影响,而不是“安全”内容的建议,导致误报率急剧上升,而漏报率没有实质性变化。研究结果突显了LLM安全评估小组的一个漏洞,即共享的社会线索会降低其性能。

  2. TOOL · CL_150852 ·

    经过微调的开放权重LLM通过了瑞典医学执业医师资格考试

    研究人员开发了一种方法,以提高开放权重大型语言模型(LLM)在专业考试中的表现。通过应用监督微调(SFT)和人类反馈强化学习(RLHF),这些模型能够通过瑞典医学执业医师资格考试。这种方法展示了将通用LLM改编以在高风险专业评估中表现出色的潜力。

  3. RESEARCH · CL_139217 ·

    vLLM 配置影响 LLM 的能耗、性能和准确性

    一篇新的研究论文探讨了在为大型语言模型 (LLM) 配置 vLLM 等推理引擎时,能耗、性能和准确性之间的权衡。该研究分析了五种开源 LLM 和五种推理任务中,注意力核类型、前缀缓存和分块预填充的组合。结果表明,注意力类型和前缀缓存对能耗和性能有显著影响,其影响因模型和工作负载而异,而在默认配置下,分块预填充的影响有限。研究还发现,推理引擎的选择可能会意外地影响模型的准确性。

  4. TOOL · CL_119486 ·

    AI模型生成与真实样本高度相似的PowerShell恶意软件

    研究人员开发了一个实验性框架,用于评估大型语言模型(LLMs)生成PowerShell恶意软件的能力。该框架包括一种新颖的沙箱方法进行动态分析,以及一个真实PowerShell恶意软件的精选数据集。研究发现,允许自由使用的、开源的LLMs可以生成与人类编写的样本高度相似的恶意软件,其中位Jaccard指数为84.5%,近一半的生成实例与真实恶意软件完全重叠。

  5. TOOL · CL_109909 ·

    开放权重LLM在解码设置中显示出鲁棒的同质性偏差

    一篇新发表在arXiv上的研究调查了开放权重大型语言模型(LLM)中的同质性偏差。研究人员发现,模型倾向于将边缘化群体描绘得比主流群体内部更加相似,并且即使在调整解码超参数时,这种偏差也保持一致。该研究测试了七个开放权重LLM,并观察到西班牙裔和亚裔美国人在各种采样设置中始终被描绘得更加同质化。研究还强调,用于信号群体身份的方法显著影响了观察到的偏差,其中基于姓名的处理方法与明确标签相比,揭示了黑人群体姓氏的偏差方向发生了逆转。