Parameter Golf
PulseAugur coverage of Parameter Golf — every cluster mentioning Parameter Golf across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Google AI 推出 Science One Framework 以验证 AI 生成的研究
Google AI 推出了 Science One Framework,这是一个旨在提高 AI 生成的科学研究可验证性的实验性系统。该框架及其附带的 CoE Audit 协议旨在消除幻觉,并确保 AI 撰写的论文中所做的声明都有可验证的证据链支持。该系统解决了诸如虚假参考文献和代码与报告结果之间不匹配等关键问题,在 MLE-Bench 和 Parameter-Golf 等基准测试中实现了零幻觉参考文献和完全可验证的分数。
-
参数高尔夫挑战在严格限制下将语言模型推向新极限
一项名为参数高尔夫的社区挑战,探索了如何在16MB的工件大小和8xH100 SXM GPU上训练时间不超过十分钟的严格限制下,实现最佳的语言模型性能。该竞赛分析了2,037个拉取请求和1,430份提交,验证后的排行榜分数提高了13.6%,从1.2244降至1.058比特每字节(BPB)。研究人员识别并分类了84种优化技术,指出虽然单独的方法很少能将BPB提高超过1%,但它们的累积效应却非常显著。研究还强调,许多技术的有效性在竞争性提交…
-
Anthropic 的 Claude Fable 5 发布引发 AI 治理辩论
Anthropic 发布了 Claude Fable 5,这是一款具有“神话级”能力的强大新 AI 模型,但其推出却引发了争议。该模型包含的保护措施会隐形地限制其在某些高级 AI 开发任务中的有效性,批评者认为这是“秘密破坏”和反进步。这引发了关于 AI 治理、国家安全以及私人创新与公众监督之间平衡的辩论,许多人呼吁更正式的监管程序。
-
AI代理Aiden在OpenAI的Parameter Golf招聘挑战赛中名列前茅
一个名为Aiden的自主研究代理在OpenAI的Parameter Golf招聘挑战赛中,表现超越了千余名人类参赛者。Aiden提交了25个拉取请求,其中7个创下了排行榜记录,显著优于下一位表现最好的人类研究员。该代理还通过整合人类贡献者开发的新分词器,展示了协作潜力,带来了显著的性能提升。
-
自动化代理自主开发AI训练配方
研究人员开发了一个自动化研究系统,该系统使用专业代理来创建有效的AI训练配方。该系统作为一个封闭的经验循环运行,每次试验都包括一个假设、代码编辑和结果,反馈会塑造后续的建议。代理自主编写代码、提交实验,并根据崩溃或准确性未达标等结果来改进配方,从而在各种基准测试中显著提高模型性能和效率。