PulseAugur
中
实时 05:01:18
实体 ChatML

ChatML

PulseAugur coverage of ChatML — every cluster mentioning ChatML across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_273906 ·

    LLM聊天模板错误导致本地模型行为问题

    本地LLM部署可能会遇到模型生成超出答案范围、忽略系统提示或因聊天模板实现不正确而丢失指令等问题。当推理过程中使用的提示格式偏离模型训练时的确切结构时,尤其是在标记对话轮次和角色的控制令牌方面,通常会出现这些问题。由于不同的模型系列使用不同的控制令牌,并且各种推理引擎(如Hugging Face Transformers、llama.cpp或NobodyWho)可能以不同的方式实现模板渲染过程,导致输入到模型的最终提示存在差异,从而产生差异。

  2. RESEARCH · CL_252516 ·

    使用 LoRA 和 Unsloth 使 LLM 微调更易于访问 · 跟踪 2 个来源

    两篇文章详细介绍了使用参数高效技术微调大型语言模型(LLM)的方法。第一篇文章解释了如何使用 LoRA(低秩适配)和 Unsloth 微调 7B LLM,展示了自定义普什图方言数据集的训练损失显著降低。第二篇文章重点介绍了 Unsloth Studio,概述了以 ChatML 格式准备对话数据集的过程,以及微调 Llama-3.1-8B 等模型以完成特定任务,并将微调与检索增强生成(RAG)进行对比。

  3. TOOL · CL_246537 ·

    编码LLM结构化文本声明被评分脚本错误驳斥

    最近的一项评估旨在测试编码语言模型在处理结构化文本方面优于通用模型的说法。该实验使用了五个不同的任务,包括JSON修复和YAML操作,并多次运行每个任务以考虑模型随机性。然而,由于在评分脚本中发现了一个错误,该错误在YAML中错误地处理了日期格式,导致无法准确评估任何模型的性能,因此评估本身被中止了。

  4. COMMENTARY · CL_242237 ·

    LLM调优:聊天模板比量化更重要

    最近对本地大型语言模型(LLM)调优的分析显示,聊天模板配置对模型性能的影响远大于量化水平。虽然量化(例如,Q4与Q8)被广泛讨论和量化跟踪,但更改模板可能导致模型无效,在基准测试中得分归零。相反,使用最小的有效量化级别可以释放资源,以实现更快的推理或更大的上下文窗口。

  5. TOOL · CL_208060 ·

    Ornith-1.0:新型开源编码模型面临集成障碍

    Ornith-1.0 是一个新推出的开源权重编码模型,其独特之处在于它在训练过程中学会构建自己的问题解决框架,而不是依赖于预先存在的框架。尽管其参数量为 9B,但它表现出强大的性能,在编码基准测试中可与 Gemma4-31B 等更大模型相媲美甚至超越。然而,用户在将其与 Ollama 等工具集成时遇到了挑战,这主要是由于模板元数据和模型用于工具调用的输出格式存在问题,需要手动配置才能正常运行。

  6. TOOL · CL_201275 ·

    Qwen 模型使用 ChatML 格式,社区改进模板

    Qwen 模型(包括 Qwen2.5 系列)使用 ChatML 格式来构建对话提示,这与 OpenAI 的早期模型类似。该格式依赖于像 和 这样的特定 token,并且需要精确的换行约定才能正常工作。开发者指出,格式不正确可能导致模型输出和性能出现细微但显著的问题。此外,最近社区的努力集中在为 Qwen 模型改进和优化 Jinja 聊天模板,旨在通过严格遵循原始训练格式来确保兼容性和最佳性能。

  7. RESEARCH · CL_95819 ·

    Handlebars LLM 提示漏洞暴露角色注入风险

    一篇新研究论文详细介绍了一种在常用于 LLM 提示的 Handlebars 模板中存在的漏洞,该漏洞可能导致结构化角色注入。研究发现,Handlebars 的默认 HTML 转义机制未能防御某些分隔符家族,从而允许攻击者伪造更高权限的对话轮次。虽然 GPT-3.5 Turbo 表现出显著的易感性,但 Claude Haiku 4.5 对这些攻击表现出很强的抵抗力。