R
PulseAugur coverage of R — every cluster mentioning R across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新书为可防御的AI系统提供实用指导
Hernan Huwyler出版了一本新书,题为《构建可防御的AI系统:安全与合规》,面向首席AI官和其他专业人士。该书提供了关于实施AI风险管理框架、监管合规和审计就绪证据的实用指导,侧重于可量化的风险和可操作的控制,而非抽象概念。它涵盖了诸如基于美元的风险量化、遵守ISO/IEC 42001和NIST AI RMF等标准、欧盟AI法案文档以及AI代理和供应商控制的实际实施等主题。
-
开源工具 Corteza 在 ARC-AGI-3 上以 Claude Opus 5 取得 98.6% 的分数
一个名为 Corteza 的开源工具,由 Troy 开发,在 ARC-AGI-3 基准测试中取得了 98.6% 的分数。这一成就的实现是使用了 Claude Opus 5,并完成了 25 个公开游戏中的全部 183 个关卡。Corteza 套件旨在在一个持久的 R 工作空间中编写和重用函数,允许数据和函数在对话压缩过程中持续存在。
-
新的 openEO API 规范旨在标准化地球观测领域的机器学习工作流
研究人员为 openEO 提出了一个新的机器学习 API 规范。openEO 是一个旨在标准化地球观测 (EO) 数据立方体访问和处理的平台。该规范旨在弥合 EO 数据格式与机器学习模型输入之间的差距,从而提高不同云基础设施上机器学习工作流的可重现性和可移植性。提议的 API 包括模型初始化、训练和推理等操作以及管理阶段,支持经典模型和深度学习模型。在 R 和 Python 中进行的原型验证已证明其可行性,但要实现完全的跨后端兼容性,…
-
OpenAI4S 代理增强 AI 辅助科学研究的可复现性
研究人员推出 OpenAI4S,一个开源的科学研究代理,旨在增强 AI 辅助计算研究的可复现性和可检查性。该系统遵循“代码即行动,科学即会话”的原则,集成了持久计算运行时和研究会话管理。OpenAI4S 利用结构化工具调用进行编排,并将科学行动作为完整的代码单元在持久的 Python 和 R 内核中执行。它通过只追加的操作日志、执行记录、版本化构件和工作区检查点来保存计算状态,旨在提高长周期和计算密集型工作流的可靠性。尽管在各种研究场…
-
AI 增强 R 编程数据处理能力,用户技能是关键
AI 工具可以显著提高 R 编程语言中数据处理的效率。然而,这些由 AI 驱动的结果的有效性和准确性取决于用户应用它们时的技能和方法。有关此主题的更多探讨,请参阅 Statistics Globe Hub。
-
博士生就人工智能研究职业的计算机科学与电子工程专业品牌定位寻求建议
一位博士生正在就其学位应选择计算机科学(CS)还是电子工程(EE)征求建议。她的研究重点是图机器学习(Graph ML),这是一个跨越这两个领域的领域。该学生担心就业市场,并希望优化其个人品牌,以期在大型科技公司担任未来的研究科学家职位。
-
编码偏好:递归 vs. 迭代
这篇帖子讨论了在编码中偏好递归或迭代方法,将其表述为关于优雅与控制的问题。它涉及数据结构和编码挑战,暗示当控制至关重要时,倾向于迭代方法。
-
Databricks 项目组成部分详解:Spark、Delta Lake、MLflow
本文分解了构成 Databricks 项目的核心组件和技术。文章强调了该平台的集成特性,重点介绍了 Apache Spark、Delta Lake 和 MLflow 等工具。解释涵盖了各种编程语言和开发环境,如 Python、R、Scala 和 Jupyter Notebooks,所有这些都在云基础设施中。
-
新的Agnostics管道提高了低资源语言中LLM的编码能力
研究人员开发了一种新的语言无关的训练后管道,称为Agnostics,旨在提高大型语言模型在低资源编程语言中的编码能力。该系统通过仅根据代码的可观察行为来判断代码,从而绕过了对特定语言数据集和基础设施的需求。Agnostics在Lua、Julia、R、OCaml和Fortran等语言中表现出显著的性能提升,甚至超越了更大的模型,并在较小参数模型的基准测试中创下了新的最先进成果。
-
新研究推进统计建模的LASSO方法
两篇新研究论文探讨了统计建模中LASSO(最小绝对收缩和选择算子)方法的进展。第一篇论文详细介绍了具有秩约束的矩阵LASSO的严格受限等距阈值,为恢复数据中的潜在结构提供了理论保证。第二篇论文介绍了“Autotune”,一种自动选择LASSO中调优参数的新策略,该策略在回归和向量自回归模型的低信噪比场景下,被证明比现有方法更快、更准确。
-
用户称AI模型可用于自动化性能基准测试
Christos Argyropoulos分享说,他发现“AI模型”对于自动化性能基准测试很有用。他使用三种markdown文件:一种用于JSON配置,Perl脚本用于运行基准测试和收集遥测数据,R用于可视化和分析。Argyropoulos指出,即使是廉价或免费的AI模型也能有效地达到此目的。
-
新算法显著加速复杂U统计量的计算
研究人员开发了一种新方法,可以更有效地计算高阶U统计量,这在统计学、机器学习和计算机科学中普遍存在。该论文介绍了一种分解技术,将U统计量转化为更易于处理的V统计量。它还探讨了使用爱因斯坦求和(一种来自量子计算的方法)来加速这些计算。一个配套的开源Python和R包“u-stats”已经发布,展示了比现有方法显著的运行时改进。
-
新的 qshap 工具可分解梯度提升树的 R²
研究人员推出 qshap,一种用于分解梯度提升决策树中 R² 值的新方法。该工具在 R 和 Python 中可用,通过分析观测值的二次损失来量化单个特征对整体模型性能的贡献。qshap 支持 XGBoost、LightGBM 和 Catboost 等流行的 GBDT 实现,利用高效的 C++ 后端,并为遗忘树提供专门的加速。
-
新统计方法使用高斯过程进行时间序列因果推断
研究人员开发了一种新的统计方法,用于中断时间序列设计的因果推断,特别适用于治疗同时影响所有单位的情况。该方法使用高斯过程回归通过从治疗前数据外推来估计反事实,保留与历史序列一致的函数,并在外推放大分歧时扩大不确定性区间。通过模拟和对最高法院 Heller 裁决后手枪购买情况的分析证明了该方法,并提供了一个名为 'gpss' 的配套 R 包以供实现。
-
新的R包SSLfmm解决了带有缺失标签的半监督学习问题
一个名为SSLfmm的新R包已被开发用于半监督学习,专门解决类别标签中混合缺失的情况。该包实现了一种基于似然的高斯有限混合分类方法,该方法在类别分布的同时对标签缺失过程进行建模。SSLfmm支持各种缺失机制,包括完全案例、完全随机缺失(MCAR)和随机缺失(MAR),并提供了一个统一的R接口用于拟合、预测和诊断。
-
基于错误文档训练的AI模型生成了不正确的代码
一位开发者发现,用于气象API的微调GPT模型训练所用的文档不准确,导致其生成了不正确的R代码。尽管API返回了错误或静默截断了请求,该模型仍自信地生成了不存在的变量的代码,并使用了过时的日期范围。这凸显了仅依赖API文档作为训练数据的风险,因为文档本身可能无法准确反映系统的当前状态或功能。
-
R 和 RStudio 现已支持 Raspberry Pi、Android 和 iPhone
本指南详细介绍了如何在便携式设备上安装和运行 R 和 RStudio,特别是 Raspberry Pi、Android 和 iPhone。它提供了在 Debian Trixie 上为 Raspberry Pi 型号设置 R-base 和 RStudio Server 的分步说明,利用了 Debian 存储库中 R-base 的可用性以及 RStudio Server 的 ARM64 端口。该帖子还讨论了在 Android 设备上使用 …
-
新的R平台GxEStat简化了基因-环境互作分析
研究人员开发了GxEStat,一个用于分析育种项目中基因型-环境互作的新R平台。该集成框架在一个工作流程中结合了显著性和稳定性评估,利用混合效应模型量化遗传和环境效应。GxEStat旨在提高多环境试验分析的效率、可重复性和可访问性,并在真实育种数据集上展示了其应用。
-
新的arXiv论文探讨因果发现方法和条件独立性检验
两篇新的arXiv论文深入探讨了因果发现,这是一个专注于从数据中揭示因果关系的研究领域。第一篇论文介绍了一种使用因果效应约束的可解释因果发现方法,该方法改编了稀有事件估计技术来处理计算挑战。第二篇论文对条件独立性检验进行了调查,条件独立性检验对于基于约束的因果发现算法至关重要,论文将其分为六个家族,并讨论了它们的假设、鲁棒性和可扩展性。
-
游戏开发公司寻求机器学习顾问,负责反作弊数据基础设施
一家游戏开发公司正在寻找一名机器学习顾问,担任兼职合同职位,负责构建反作弊基础设施的基础。该顾问将负责设计数据模式、捕获管道和存储格式,建立标注分类法,并定义处理不确定案例和标注质量的工作流程。理想的候选人应具备机器学习数据管道、异常检测和人工干预式标注系统的经验,优先考虑有游戏或网络安全经验者。