实体
Hermes 4.3
Hermes 4.3
PulseAugur coverage of Hermes 4.3 — every cluster mentioning Hermes 4.3 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
开发者详解为 Home Assistant 任务构建 LLM 测试平台
一位开发者详细介绍了构建一个用于评估本地大型语言模型(LLM)的测试平台的流程,特别关注它们在 Home Assistant 环境中管理任务和数据的能力。该开发者分叉了一个现有的开源基准测试,并扩展了其功能,使其除了原有的 Home Assistant 设备控制外,还包括了日历和投资组合管理。这个过程包括创建用于日历操作的新工具,并设计一个只读的投资组合数据接口以避免无监督交易,同时还修复了原始基准测试配置中一个预先存在的错误。
-
Qwen 3.6 在本地 AI 代理测试中领先,Muse Glimmer 表现强劲首秀
最近一次对本地 AI 代理的性能比拼显示,Qwen 3.6 仍是顶级表现者,而新发布的 Muse Glimmer 模型也令人瞩目地首次亮相。评估侧重于实际的个人助理任务,而非传统的基准测试,测试模型控制智能家居设备、管理日历和待办事项列表以及生成代码的能力。尽管 Qwen 获胜,但作者计划在接下来的一个月里将 Muse Glimmer 作为日常主力使用,因为它表现出潜力且是近期发布的模型。