QwenLM
PulseAugur coverage of QwenLM — every cluster mentioning QwenLM across labs, papers, and developer communities, ranked by signal.
-
阿里巴巴Qwen推出电商基准,用于自主代理评估
阿里巴巴Qwen推出了E-Commerce Bench,这是一个旨在评估自主代理在长周期业务运营中表现的新基准。该基准模拟了以10万元人民币的初始资本运行在线商店一整年的场景,涵盖了采购、谈判、定价和库存管理等任务。评估整合了真实世界的电商数据,包括产品详情、供应商信息和运营成本,并超越了单纯的年末资产评估,从七个维度对代理进行考核。
-
Aider、Qwen Code CLI 和 OpenCode 在本地编码助手基准测试中对决
对三个本地命令行 AI 编码助手 Aider、Qwen Code CLI 和 OpenCode 的比较,揭示了它们在设置、性能和资源使用方面的显著差异。Aider 和 OpenCode 使用 Ollama 设置起来很简单,而 Qwen Code CLI 需要特定的配置,如 Jinja 模板和更大的上下文窗口才能正常运行。在测试 12 个常见编码任务时,Aider 取得了完美的成功率,OpenCode 有一次部分成功,而 Qwen Co…
-
在授予访问权限之前,以只读模式评估 Qwen 编码代理
本文详细介绍了一种在授予 Qwen 编码代理写入代码库的权限之前,以只读模式评估其性能的方法。作者提出了一种涉及隔离任务集的过程,其中手动审查代理建议的代码更改(diff)。此方法旨在确定代理建议的有用性,同时避免对实际代码进行意外修改的风险。文章还涉及 Qwen Code 的各种批准模式和身份验证协议,并建议可以使用相同的代理与 OpenAI、Anthropic、Gemini 和 DeepSeek 等不同的后端进行测试,以进行全面评估。
-
商汤发布新AI模型,FlashQLA加速GPU,YAML管道缩短分析时间
商汤发布了其新的SenseNova V6图像模型,该模型专为中国硬件优化,以规避美国制裁。这一发展凸显了中国对AI自给自足的战略推动。同时,QwenLM团队推出了FlashQLA,一个开源的线性注意力内核库,显著提高了NVIDIA Hopper GPU的性能,有望加快AI训练和推理速度。