PulseAugur
实时 10:13:04
实体 Kim

Kim

PulseAugur coverage of Kim — every cluster mentioning Kim across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
时间线
  1. 2026-05-18 research_milestone Researchers release the Grounded Integration Measure (GIM) benchmark for evaluating AI models. 来源
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_180555 ·

    研究发现:对抗性自我博弈对人工智能法律推理无益

    一项最近在arXiv上发表的研究调查了对抗性自我博弈在提高人工智能模型法律推理能力方面的有效性。研究发现,对抗性自我博弈的竞争性方面,即学生模型的论点受到对手的攻击,并未比非竞争性训练方法提供任何可靠的益处。在多项测试中,竞争性成分未带来显著改进,盲审结果显示两种方法胜率接近50%。该研究强调了可验证的训练环境而非竞争本身对于增强人工智能法律推理能力的重要性。

  2. TOOL · CL_167419 ·

    人形机器人Kim获得个性化情景记忆,以改善社交互动

    研究人员为人形机器人Kim开发了一个轻量级情景记忆模块,将大型语言模型与基于向量的语义检索相结合。该模块通过使机器人能够回忆过去的互动来增强对话式AI,从而提高人机互动中感知的社交性、可信度和温暖度。评估表明,该记忆系统在不增加干扰感或隐私担忧的情况下,显著提升了这些社交指标。

  3. TOOL · CL_165124 ·

    新方法在实值函数中编码序和树

    研究人员开发了在实值函数中编码序和树的新方法,这与组合学和统计学习理论中的定量结果有相似之处。这些进展改进了从树中提取阈值属性和顺序 fat-shattering 维度的界限。这项工作解决了与稳定函数的定量正则性引理和对偶顺序 fat-shattering 维度相关的开放性问题,与之前的研究相比,提供了更强的形式和改进的界限。

  4. COMMENTARY · CL_145978 ·

    Sam Altman 考虑持有 OpenAI 3 亿美元股份;韩国婚介新闻浮出水面 · 跟踪 3 个来源

    据报道,OpenAI 首席执行官 Sam Altman 正在考虑持有该公司 3 亿美元的股份,旨在按照此前的承诺,将人工智能财富与美国人分享。此消息传出之际,其他报道则突出了韩国的独特情况,包括芯片工人因父母的担忧而被纳入婚介服务,以及个人接受眼部移植手术。

  5. RESEARCH · CL_114772 ·

    阿里巴巴被指与大规模Claude AI模型蒸馏攻击有关 · 追踪到1个来源

    Anthropic公司披露了一起前所未有的AI盗窃企图,据称与阿里巴巴有关的运营者在44天内使用了2880万次查询来蒸馏Claude的高级能力。这次通过近25000个欺诈账户进行的超大规模数据泄露事件,远超以往任何事件,并凸显了不断升级的“蒸馏军备竞赛”。该事件重新点燃了中美科技紧张关系,并引发了对新AI安全措施的呼吁,包括可能将蒸馏攻击者列入黑名单。

  6. RESEARCH · CL_107438 ·

    朝鲜将为海军装备核武器,建造更大军舰

    朝鲜领导人金正恩宣布计划为国家海军装备核武器并建造更大的军舰。在新型驱逐舰“崔贤”号的服役仪式上,金正恩表示海军的核武装计划正按计划进行。他还概述了连续建造万吨级战略军舰的战略,目标是每年生产两艘。

  7. COMMENTARY · CL_89596 ·

    朝鲜承诺与俄罗斯建立军事同盟

    朝鲜领导人金正恩已表达对俄罗斯及其政策的坚定支持,标志着两国之间军事同盟的深化。这种被描述为“牢固的军事同盟”和“历史新篇章”的加强关系,建立在2024年6月签署的《全面战略伙伴关系条约》之上。金正恩在俄罗斯日致普京的贺电,凸显了朝鲜与俄罗斯联邦站在一起的承诺。

  8. RESEARCH · CL_38236 ·

    GIM基准测试在整合认知任务上评估LLM

    研究人员推出了Grounded Integration Measure (GIM),这是一个旨在通过整合多个认知域来评估大型语言模型的新基准。GIM包含820个原创问题,需要对可访问的知识进行各种认知操作的协调,旨在评估基于现实任务的推理,而不是纯粹的记忆或抽象推理。该基准包括一个公共-私有划分,用于污染诊断,并利用在28个模型超过200,000个提示-响应对上校准的IRT模型来生成强大的能力估计和全面的排行榜。