PulseAugur
中
实时 13:03:25
实体 Korean

Korean

PulseAugur coverage of Korean — every cluster mentioning Korean across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
78
90 天内 78
发布 · 30天
0
90 天内 0
论文 · 30天
54
90 天内 54
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/5 页 · 共 83 条
  1. TOOL · CL_286837 ·

    新研究将LLM中的灾难性遗忘定位到输出嵌入

    研究人员发现,大型语言模型中的灾难性遗忘(模型在持续训练中会丢失先前学到的信息)存在于新训练数据中未出现的token的输出嵌入中。这种遗忘是由Adam的二阶矩归一化所放大的持续的、单向的softmax梯度驱动的。为解决此问题,提出的解决方案包括在训练期间增加Adam的epsilon值,特别是针对输出投影层。这一调整在不影响新学习或需要模型特定调优的情况下,显著减少了各种模型大小和系列的遗忘,并补充了现有的基于重放的方法。

  2. TOOL · CL_285727 ·

    词汇表层提升LLM翻译一致性

    dev.to上的一篇博文提出了一种词汇表层方法,以提高LLM翻译的一致性,特别是在小说或漫画等长文本中的角色名称和术语。该方法涉及创建一个结构化的源术语及其期望目标渲染的词汇表,然后在每次翻译片段的提示中动态地仅包含该词汇表中相关的术语。这种方法旨在防止LLM在没有先前决策记忆的情况下处理孤立文本块时出现的不一致性。

  3. RESEARCH · CL_275056 ·

    多智能体LLM框架改进体检解读

    研究人员开发了一种多智能体大型语言模型(LLM)框架,旨在解读个性化的体检结果并提供指导。该系统识别用户意图,将其分配给专门的智能体进行并行执行,并综合结果。对韩国查询的评估表明,与单智能体系统相比,多智能体方法提高了LLM评分和用户偏好,尤其是在涉及个人记录查询的情况下。然而,多智能体系统也导致了延迟和成本的增加。

  4. TOOL · CL_261500 ·

    新的基准KoNeoBench测试大型语言模型对韩语新词的理解能力

    研究人员推出了KoNeoBench,这是一个旨在评估大型语言模型对韩语新词理解能力的新基准。该数据集包含自2020年以来在在线新闻中发现的1785个新词,每个新词都附有使用示例、构词分析和定义。使用KoNeoBench进行的实验显示,当前的大型语言模型在识别词语组成部分、区分语义类别以及为这些新词生成准确定义等任务上存在困难。

  5. TOOL · CL_261444 ·

    PaGNet 结合 GBDT 和神经网络进行公司避税预测

    研究人员开发了 PaGNet,这是一种新颖的混合模型,结合了梯度提升决策树 (GBDT) 和神经网络来预测公司避税代理。该模型解决了从复杂的公司-年份面板数据中提取预测信号的挑战,同时确保了模型行为的透明度。PaGNet 采用双分支架构,一个分支使用 LightGBM 进行面板-时间摘要,另一个分支使用具有基于注意力的时间聚合和多任务学习的 Panel-MLP。在韩国公司数据上的评估表明,PaGNet 能够提高相对于现有基线的解释方差…

  6. TOOL · CL_259598 ·

    Apple 的 iOS 27.2 beta 为 Siri AI 新增了语言

    Apple 最新的 iOS beta 版本 27.2 将 Siri 的 AI 功能扩展到了包括法语、日语、韩语、葡萄牙语和西班牙语在内的多种新语言。此次更新建立在现有的仅限英语的 Siri AI 功能之上,为全球用户提供了更广泛的可访问性。此次扩展旨在让更多全球用户能够使用 Siri 的高级 AI 功能。

  7. TOOL · CL_259069 ·

    330 个大型语言模型接受韩语测试;许多模型未能遵守脚本规范

    最近对 330 个语言模型进行的评估测试了它们在韩语任务上的表现,揭示了在脚本规范方面存在严重问题。相当一部分模型未能保持正确的脚本使用,许多回答包含错误的字母或中日文等其他语言的字符。评估采用了一种机械检查方法,在人工评委评估内容之前检查脚本污染,确保只有语言上合理的回答才会被评分。值得注意的是,发布日期、模型大小和英语基准测试表现等因素与韩语任务的成功与否无关,一些较旧的模型和较小的变体取得了满分。

  8. TOOL · CL_256818 ·

    为韩国企业开发了AI代理验证工具

    一位开发者创建了一个远程MCP服务器,旨在允许AI代理使用官方数据来验证韩国企业。该项目在Mastodon上进行了详细介绍,旨在利用AI进行业务验证流程。

  9. TOOL · CL_252180 ·

    新的“合成闪烁”方法分析动态处理效应

    研究人员开发了一种名为“合成闪烁”(synthetic blips)的新方法,用于分析在单位接受多种顺序处理的情况下动态处理效应。该方法通过使用反向归纳过程将处理效应表示为其他单位效应的线性组合,从而推广了合成控制方法,避免了复杂的组合要求。该方法旨在提供一致的估计量,并已应用于韩国公司层面面板数据,以估计个体动态处理效应和金融支持的最佳分配规则。

  10. TOOL · CL_252022 ·

    新的韩语 LLM 基准 KoSimpleQA 揭示了显著的事实性差距

    研究人员推出了 KoSimpleQA,这是一个旨在评估大型语言模型 (LLM) 在韩语文化知识方面事实性的新基准。该基准包含 938 个简短、寻求事实且答案明确的问题。初步评估显示,即使是支持韩语的最佳开源 LLM 在 KoSimpleQA 上的准确率也仅为 31.6%,表明其难度很高。研究还发现,在 KoSimpleQA 上的表现与英语基准显著不同,这表明需要进行特定语言的评估,并且推理能力有助于弥合 LLM 中的跨语言知识差距。

  11. TOOL · CL_249520 ·

    韩国 LLM 对齐导致响应发生意外变化

    研究人员调查了将韩国 27B 语言模型 Qwen3.8-27B 对齐到特定响应风格所带来的意外后果。研究发现,尽管该模型在冗长、列表使用和 markdown 方面进行了训练,但它在回答模糊的社会问题方面的倾向以及在未提示的情况下披露证券指导方面也发生了变化。这些变化主要体现在模型的输出策略上,影响了它响应的频率和回复的长度。研究强调,响应式对齐的目标可能导致脱靶效应,影响了训练未明确针对的行为。

  12. TOOL · CL_247720 ·

    新方法提高多语言视频转录准确性

    研究人员开发了提高多语言视频语音转录准确性的方法,旨在帮助创建用于跨文化理解的自动化工具。利用公开的YouTube视频和基于Whisper的工具,初步观察到七种语言的平均转录错误率为30%。通过少量微调数据,该错误率降低到20%,使转录结果更适用于下游应用。相关的语音和元数据已发布给社区,以供进一步实验。

  13. TOOL · CL_245247 ·

    新框架改进韩语音识别错误校正

    研究人员开发了一种名为 Detector-Gated Contextual Span Correction (DCSC) 的新纯文本框架,以改进韩语音识别错误校正。该方法旨在解决像韩语这样低资源语言的标注数据稀缺问题,而这常常阻碍现有自动语音识别 (ASR) 模型的性能。DCSC 利用了一个大规模韩语基准数据集 DasanCallDial,该数据集包含超过 1,900 个对话,用于训练一个模型,该模型可以检测和纠正 ASR 文本中的细…

  14. TOOL · CL_245013 ·

    LoGAN框架使用VLM代理进行多语言字体本地化

    研究人员推出LoGAN,一个利用视觉语言模型(VLM)促进多语言字体本地化的新颖框架。该方法将复杂的任务分解为几个组成部分,包括一个字形级扩散模型、风格微调以及间距/字偶距迁移,所有这些都由VLM代理协调。LoGAN展示了广泛的语言覆盖范围,特别是对CJK语言,并在字形保真度、风格、纹理和字偶距一致性方面优于现有的图像编辑和字体生成模型。

  15. TOOL · CL_244846 ·

    大型语言模型审议在模拟中难以代表民众意见

    一篇新的研究论文探讨了使用多智能体大型语言模型审议来模拟公众话语,发现虽然这些模拟可以产生合理的论点并显示出显著的意见转变,但它们难以准确地代表人口意见模式。该研究使用基于人口普查的韩国角色来辩论政策问题,揭示了角色智能体未能可靠地反映人类数据中存在的群体差异。此外,观察到的大部分意见转变独立于同伴交流发生,密封独白智能体表现出与完整辩论相似的转变,这表明论点生成和互动驱动的意见转变并非总是耦合的。

  16. TOOL · CL_244019 ·

    Apple 的 Siri AI 将于 10 月扩展到五种新语言

    Apple 将于 10 月开始将其重新设计的 Siri AI 扩展到五种新语言:法语、日语、韩语、葡萄牙语和西班牙语。这款由 AI 驱动的助手已在英语中进行 beta 测试,并将于 9 月 14 日随 iOS 27、iPadOS 27 和 macOS Golden Gate 广泛发布。要使用 Siri AI,用户需要 iPhone 15 Pro 或更新机型,而 iPhone 17 Pro 及更高版本将提供更高级的设备端模型,以增强语音识别功能。

  17. TOOL · CL_239611 ·

    韩国AI Foundry重组模型,跳过昂贵的预训练

    一个小型韩国团队开发了一种“AI Foundry”方法,将重点从昂贵的LLM预训练转移到模型诊断、重组和特定领域优化。该方法涉及使用行为和表示探测来检查训练模型的可靠性,以及进行供应链检查以识别安全风险。通过结合具有互补优势的开放模型,他们的目标是以比从头开始更有效的方式创建专业模型,并取得了显著的下载量,赢得了Google x Hugging Face的挑战赛。

  18. SIGNIFICANT · CL_239001 ·

    韩国初创公司VIDRAFT宣布独立AI基础模型

    韩国AI初创公司VIDRAFT宣布已开发出独立的AI基础模型。该公告通过官方政府政策简报渠道发布,表明该模型对AI主权具有国家意义。在现有来源文本中未披露具体技术细节、模型名称和性能基准,也未确认任何公开访问渠道。

  19. TOOL · CL_231318 ·

    新基准显示大型语言模型无法追踪客户财务历史

    引入了一个名为 FinLifeBench 的新基准,用于评估大型语言模型从银行对话中随时间重建客户的生命事件和财务状况的能力。该基准包含 6,000 次韩国银行会话,揭示了当前的大型语言模型在维护完整且时间有效的纵向记录方面存在困难。随着会话数量的增加,性能会显著下降,模型经常遗漏事件或将过时的财务信息视为当前信息。

  20. TOOL · CL_229201 ·

    新基准揭示 LLM 在精确文本结构重建方面存在困难

    研究人员开发了 OrderProbe,这是一个旨在评估大型语言模型 (LLM) 重建文本精确结构顺序能力的新基准。与允许多种正确重排的先前方法不同,OrderProbe 使用固定的四字符中文、日文和韩文字符串来实现精确匹配评分。对十二个 LLM 的实验显示,即使是先进的模型也难以胜任这项任务,在零样本恢复中的准确率通常低于 35%,这表明语义理解与精确结构重建之间存在差距。