实体
Qwen 3 0.6B
Qwen 3 0.6B
PulseAugur coverage of Qwen 3 0.6B — every cluster mentioning Qwen 3 0.6B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新的700M参数模型Shibai-700M-Base在18B token上进行了训练
一位名为TheOneWhoWill的用户预训练了一个名为Shibai-700M-Base的7亿参数语言模型。该模型在180亿token上进行了训练,并针对Python和Wikitext进行了优化,计划进一步在基于docstring的Python代码上进行训练。该模型设计用于下一个token预测而非聊天,并且被认为比GPT-2有显著提升。
-
丹麦活动家被搜查,本地LLM微调展现潜力,AI的社会影响得到探讨 · 跟踪3个来源
丹麦隐私活动家Lars Andersen遭到警方搜查,引发了对言论自由和激进主义界限的担忧。另外,对Qwen 3 0.6B等本地LLM进行微调已成功用于问题分类,表明自然语言处理方面取得了进展。此外,Cory Doctorow的书《人工智能后的生活反向半人马指南》探讨了人工智能的社会影响和潜在成本。
-
DriftSched 通过自适应调度提高 LLM 推理效率
研究人员开发了 DriftSched,一个旨在提高大型语言模型多租户 GPU 推理效率的框架。该系统通过使用自适应偏差校正将估计误差减少 40% 以上,解决了运行时令牌漂移(实际输出长度偏离初始估计)的挑战。实验表明,最短作业优先 (SJF) 调度策略与 DriftSched 结合使用可显著降低延迟,中位数端到端延迟下降约 42%。该框架还包括一个用于运行时反馈驱动漂移补偿的机制,以及一个用于评估共享 GPU 基础设施上 QoS 感知…