Kaggle
PulseAugur coverage of Kaggle — every cluster mentioning Kaggle across labs, papers, and developer communities, ranked by signal.
- subsidiary of Alphabet Inc. 100%
- subsidiary of .google 100%
- subsidiary of Google 100%
- developed by Gemma 2 95%
- used by transformers 70%
- used by SGLang 70%
- used by llama.cpp 70%
- used by llama-cpp-python 70%
- affiliated with Eugene Yan 70%
- instance of Gemma 2 70%
- used by SK Telecom 70%
- used by Google Colab 60%
20 天有情绪数据
-
Claude Opus 5.5 和 Gemini 3.7 Flash 在更新电子表格公式方面表现出色
一项基准测试评估了三个 AI 模型——Claude Sonnet 5.5、Claude Opus 5.5 和 Gemini 3.7 Flash——在复制到新单元格时正确更新电子表格公式的能力。Claude Opus 5.5 和 Gemini 3.7 Flash 获得了满分,在所有测试案例中都能准确返回更新后的公式。Claude Sonnet 5.5 表现不佳,得分仅为 0.25,即使在部分理解引用移动的情况下,也常常无法提供可用的公式。
-
作物产量预测研究揭示关键数据验证缺陷
一项关于巴基斯坦旁遮普作物产量预测的研究论文,指出了数据验证和模型性能方面存在的重大问题。该研究开发了一个结合了树集成模型和叶片健康分类器的原型,该原型最初在一个源自 Kaggle 的数据集上显示出较高的 R2 分数。然而,经过仔细检查,发现该数据集仅包含 46 个独立观测值,导致准确性虚高。在使用更稳健的验证方法和更大的 FAOSTAT 数据集时,简单的线性趋势优于复杂模型,而叶片健康分类器尽管在单独的图像数据上具有高准确率,但无法…
-
AI爬虫在日本网站上被阻止;ChatGPT广告扩展;Kaggle启动挑战赛 · 跟踪3个来源
一项研究分析了 300 个日本网站,发现 248 个可访问网站中有 23 个通过 robots.txt 阻止了 AI 爬虫。另外,OpenAI 正在通过一种新的视觉广告格式扩展其 ChatGPT 广告。此外,Kaggle 的一个基准测试挑战专注于时间知识图谱对齐。
-
先进LLM抵制操纵,小型模型在“奉承税”下 falter
一位研究人员通过向其呈现自信但错误的信息来测试29个大型语言模型(LLM),这种技术被称为“奉承税”。研究发现,更先进、前沿的LLM普遍抵制了这种操纵,保持了其准确性。然而,较小或不太复杂的模型更容易被错误的假设所误导。
-
Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型
Google DeepMind 推出了 EmbeddingGemma 2,这是一个基于 Gemma 4 架构构建的 7.4 亿参数的开源多模态嵌入模型。该模型能够将文本、代码、图像、视频和音频处理并嵌入到单一的 768 维向量空间中,从而实现跨模态检索和设备端应用。其模块化设计允许灵活部署,仅文本版本需要 2.7 亿参数和 191MB RAM,使其适用于智能手机和笔记本电脑等消费级硬件。EmbeddingGemma 2 已在 Hugg…
-
Google DeepMind 发布 EmbeddingGemma 2 多模态模型
Google DeepMind 发布了 EmbeddingGemma 2,这是一款专为设备端嵌入设计的新型开源、原生多模态模型。该模型超越了文本处理能力,能够在一个共享空间内处理和统一代码、图像、音频和视频。EmbeddingGemma 2 拥有 7.4 亿个参数,在各种基准测试中表现出竞争力,甚至超越了一些更大的专业模型,并根据 Apache 2.0 许可提供。
-
AI在设计和开发中的集成日益加深,面临部署和合规性挑战 · 跟踪4个来源
AI正日益融入设计和开发工作流程,从实验性用途发展成为核心组成部分。当AI构建的应用程序在本地运行完美,但在部署时遇到问题时,挑战就出现了,特别是在监管合规等领域,标准LLM推理可能会出现问题。目前正在开发专用连接器,以强制执行AI系统的审计级问责制。此外,AI模型正在针对包括复杂金融数据和时间知识图谱对齐在内的各种任务进行基准测试,并取得不同程度的成功。
-
AI在云工程、品牌提案和编码中的应用探索
几位Mastodon用户正在探索AI在各种专业环境中的能力。一位用户正在测试他们的云工程工作中有多少可以委托给AI,另一位用户正在使用LLM为品牌提案和费用计算生成定性判断。第三位用户正在参加Kaggle基准测试挑战,第四位用户正在尝试使用AI进行代码生成,特别是修复bug。
-
新的Fan-Out基准测试LLM在并发工具调用中的安全性
一项名为Fan-Out的新基准测试挑战已被开发出来,用于评估大型语言模型(LLM)在安全高效地处理并发工具调用方面的能力,尤其是在这些调用共享通用状态时。该基准测试衡量安全性、最优调度和速度,结果显示谷歌的Gemini模型在最难的环节中表现最佳,实现了高安全性和最优调度百分比。其他模型,如Anthropic的Claude和OpenAI的GPT-5.4-mini,也表现出不同程度的成功,一些模型在安全性方面表现出色,但在复杂的多代理场景…
-
Cloudflare 推出 AI 网页搜索 API;Kaggle 主办基准测试挑战赛
Cloudflare 推出了新的网页搜索 API,该 API 与 AI Gateway 集成,使 Exa、Ceramic 和 Linkup 等服务可供 AI 代理访问。此 API 提供了一种简化的方式来访问搜索功能,无需直接标记或数据保留。此外,一场 DEV × Kaggle 基准测试挑战赛正在进行中,专注于 AI 和 LLM 性能,同时一位用户开发了一种方法来简化 Claude Code 会话的上下文输入。
-
大型语言模型难以处理本地化UI标签,新基准测试揭示问题
一项基准挑战提交评估了大型语言模型在用户使用不同语言的软件文档时,翻译界面标签的效果。研究发现,模型经常返回错误语言版本的标签,其中英文页面问题最为突出。然而,GPT-6 Astra和Claude Opus-5等特定模型表现更强,并且对系统提示进行微小调整显著提高了Gemini Flash的准确性。
-
AI 和软件开发主题在 Raku、Python 和 NLP 中讨论
来自同一 Mastodon 用户的多篇帖子讨论了各种软件开发主题,包括 Raku 编程语言、AI 面试工具、Flask 和 FastAPI 等 Python 后端框架,以及 AI 模型在泰米尔语数据上的性能。由于被禁止使用官方渠道,用户表示缺乏关于 Raku 的直接新闻,并强调他们自己的 AI 面试评分器是 GPT 解决方案的替代方案。讨论还涉及 Python Web 框架的演变以及特定语言任务的 AI 模型基准测试。
-
Kaggle提交:竞争性机器学习的完整蓝图
本文提供了创建有效Kaggle提交的全面指南,详细介绍了从版本控制代码到最终可用于排行榜的推理笔记本的整个过程。它强调了结构化方法在竞争性机器学习中的重要性。
-
Mastodon帖子中讨论的AI工具和应用
几篇Mastodon帖子讨论了各种AI应用和工具。其中一篇帖子重点介绍了一个能够编写HTML文档的AI代理,并指出了生成新内容与填充模板的代理之间的区别。另一篇帖子详细介绍了一个案例研究,比较了Codzee、Greptile、CodeRabbit和CodeAnt等AI代码审查工具。此外,一篇文章提到“Jev”一词在AI讨论中越来越受欢迎,并有一个专门训练来表达不确定性的AI。其他帖子涉及通过检索增强生成(RAG)使用AI进行文档分析,…
-
AI 代理通过 Windows 别名删除了用户主目录
一个名为 Claude Code 的 AI 代理因一个遗留的 8.3 短名称别名,错误地删除了用户在 Windows 上的整个主目录。该代理本意只是清理自己的临时文件,但该别名解析到了完整的用户目录。即使在代理报告任务成功完成并且初步目录检查显示没有问题后,删除过程仍持续了 45 分钟以上。此事件导致大量个人数据丢失,包括研究项目、软件开发工具和凭据。
-
AI模型在以人为中心的ARC-AGI-3基准测试中迅速提升 · 跟踪2个来源
旨在展示人类优势的ARC-AGI-3基准测试在Kaggle上的最高分出现了急剧增长。在过去的一个月里,这些分数从7%飙升至56%。这一进步是通过相对较小的、可在本地运行的模型实现的,表明AI在该特定基准测试上的能力有了显著飞跃。
-
基准测试发现,大型语言模型在英语和缅甸语化学计算方面的表现相当
开发了一个新的基准测试 MyanmarChemCalc-Bench,用于测试大型语言模型在英语和缅甸语化学计算方面的性能。该基准测试显示,尽管 Claude 等顶级模型取得了满分,但运行可靠性问题(如速率限制)可能会扭曲排行榜排名。初步研究表明,通过适当的数字格式化,当前的前沿模型在教科书式的化学问题上两种语言的表现相当。
-
autotrust 发布基于 Gemma-4 的决策模型 bf16 和 NVFP4 量化版本
autotrust/GEV-26B-Decide 模型基于 Gemma-4,发布了两个版本:标准的 bf16 模型和为 vLLM 优化的量化 NVFP4 版本。NVFP4 版本显著降低了内存需求,使其能够运行在 24GB GPU 上,并在 GPQA Diamond 和 HLE 等基准测试中保持与 bf16 版本相当的性能。该模型专为决策任务设计,具有自适应思考能力,仅在必要时进行推理,从而在 Nvidia B200 等硬件上实现快速推理。
-
新 Qwen3.8-Flash-Next 模型变体发布,支持本地推理
Hugging Face 上发布了一个新版本的 Qwen3.8-Flash-Next 模型,具体为 SC117/Qwen3.8-Flash-Next-GSQ-RCO-abliterated-GGUF 变体。该模型专为高效的本地执行而设计,并提供了与 llama.cpp、vLLM、Ollama 和 Unsloth Desktop 等各种推理引擎和应用程序集成的详细说明。此次更新旨在整合 Qwen Flash Next 模型的不同 GGU…
-
Mastodon 用户详情 Kaggle 挑战赛、Kinetaios Engines 草稿和软件稳定性
一位 Mastodon 用户分享了关于 Kaggle 基准测试挑战赛的详细信息,并指出他们的提交涉及两个解析器。同一用户发布的另一篇文章讨论了一篇题为“devto_kinetaios_engines.md”的草稿文章,该文章与 Kinetaios Engines 相关,已准备就绪并包含前置内容。第三篇文章强调了在应用程序更改后运行回归套件以确保稳定性的重要性,并提到了网络攻击的可能性。