R
PulseAugur coverage of R — every cluster mentioning R across labs, papers, and developer communities, ranked by signal.
13 天有情绪数据
-
新统计方法使用高斯过程进行时间序列因果推断
研究人员开发了一种新的统计方法,用于中断时间序列设计的因果推断,特别适用于治疗同时影响所有单位的情况。该方法使用高斯过程回归通过从治疗前数据外推来估计反事实,保留与历史序列一致的函数,并在外推放大分歧时扩大不确定性区间。通过模拟和对最高法院 Heller 裁决后手枪购买情况的分析证明了该方法,并提供了一个名为 'gpss' 的配套 R 包以供实现。
-
新的R包SSLfmm解决了带有缺失标签的半监督学习问题
一个名为SSLfmm的新R包已被开发用于半监督学习,专门解决类别标签中混合缺失的情况。该包实现了一种基于似然的高斯有限混合分类方法,该方法在类别分布的同时对标签缺失过程进行建模。SSLfmm支持各种缺失机制,包括完全案例、完全随机缺失(MCAR)和随机缺失(MAR),并提供了一个统一的R接口用于拟合、预测和诊断。
-
基于错误文档训练的AI模型生成了不正确的代码
一位开发者发现,用于气象API的微调GPT模型训练所用的文档不准确,导致其生成了不正确的R代码。尽管API返回了错误或静默截断了请求,该模型仍自信地生成了不存在的变量的代码,并使用了过时的日期范围。这凸显了仅依赖API文档作为训练数据的风险,因为文档本身可能无法准确反映系统的当前状态或功能。
-
R 和 RStudio 现已支持 Raspberry Pi、Android 和 iPhone
本指南详细介绍了如何在便携式设备上安装和运行 R 和 RStudio,特别是 Raspberry Pi、Android 和 iPhone。它提供了在 Debian Trixie 上为 Raspberry Pi 型号设置 R-base 和 RStudio Server 的分步说明,利用了 Debian 存储库中 R-base 的可用性以及 RStudio Server 的 ARM64 端口。该帖子还讨论了在 Android 设备上使用 …
-
新的R平台GxEStat简化了基因-环境互作分析
研究人员开发了GxEStat,一个用于分析育种项目中基因型-环境互作的新R平台。该集成框架在一个工作流程中结合了显著性和稳定性评估,利用混合效应模型量化遗传和环境效应。GxEStat旨在提高多环境试验分析的效率、可重复性和可访问性,并在真实育种数据集上展示了其应用。
-
新的arXiv论文探讨因果发现方法和条件独立性检验
两篇新的arXiv论文深入探讨了因果发现,这是一个专注于从数据中揭示因果关系的研究领域。第一篇论文介绍了一种使用因果效应约束的可解释因果发现方法,该方法改编了稀有事件估计技术来处理计算挑战。第二篇论文对条件独立性检验进行了调查,条件独立性检验对于基于约束的因果发现算法至关重要,论文将其分为六个家族,并讨论了它们的假设、鲁棒性和可扩展性。
-
游戏开发公司寻求机器学习顾问,负责反作弊数据基础设施
一家游戏开发公司正在寻找一名机器学习顾问,担任兼职合同职位,负责构建反作弊基础设施的基础。该顾问将负责设计数据模式、捕获管道和存储格式,建立标注分类法,并定义处理不确定案例和标注质量的工作流程。理想的候选人应具备机器学习数据管道、异常检测和人工干预式标注系统的经验,优先考虑有游戏或网络安全经验者。
-
flowengineR框架增强了R中机器学习工作流的可复现性
一个名为flowengineR的新R包已被开发出来,用于创建可复现且可扩展的机器学习管道工作流。该框架的特别动机来自于算法公平性方面的挑战,因为新的指标和方法层出不穷。flowengineR为机器学习管道的各个阶段提供了一个标准化的架构,包括数据拆分、预处理、训练和评估,从而可以轻松比较和整合不同的干预措施。该设计借鉴了工作流语言和可视化编程工具的灵感,优先考虑透明度和可审计性,而不仅仅是并行执行。
-
新的R包neuralGAM提供可解释的深度学习模型
一个名为neuralGAM的新R包已被开发出来,以解决神经网络中的“黑箱”问题。该包实现了一个基于广义可加模型(Generalized Additive Models)的拓扑结构,允许估计每个特征对输出的贡献。由此产生的深度学习模型既准确又可解释,并且在神经网络架构方面具有灵活性。
-
新的 Rust 随机森林 'Fru' 比 scikit-learn 和 ranger 速度更快
一种新的基于 Rust 的随机森林实现 Fru 已开发完成并发表在 Software X 期刊上。该实现相比现有的流行库在性能和可扩展性方面都有显著提升。Fru 在 Python 中实现了 scikit-learn 几倍的速度,并且通常比 R 的 ranger 包快百分之几十,在特定用例中速度提升潜力可达几倍。该项目还引入了一种新颖的排列重要性实现,并为 Python 和 R 提供了绑定,可与 pandas 和 polars 等库无缝集成。
-
新基准评估大型语言模型投资逻辑,超越利润考量
研究人员推出了 InvestLogicBench,一个旨在评估大型语言模型投资推理能力的新基准。与以往侧重于静态问答或总体利润的方法不同,该基准根据投资者的个人情况、市场事件和推理过程,评估大型语言模型决策的逻辑一致性和依据。对领先的大型语言模型的初步测试显示,尽管它们的逻辑合理性很高,但它们对特定事件的依据却很薄弱,这表明仅凭结果进行的评估可能会掩盖有缺陷的推理。
-
北大发布开源 Claude Science 替代品 OpenAI4S
北京大学和元空间 AI Agent Lab 的研究人员发布了 OpenAI4S,这是一个开源的科学研究代理,模仿了 Anthropic 的闭源 Claude Science 的能力。这个新的代理在 MIT 许可下可用,专注于“代码即行动”的方法,允许 AI 在持久环境中直接生成和执行 Python 或 R 代码。OpenAI4S 旨在将 AI 集成到完整的科研工作流程中,从数据检索和分析到报告生成,并高度重视使用真实数据和计算,避免捏造结果。
-
新统计检验“Hunt-and-test”用于半参数假设
研究人员开发了一种名为Debiased Score Test的新统计方法,旨在通过检查对数似然的导数来评估半参数假设。该方法可扩展到检验回归函数是否属于线性函数类,为广义可加模型和部分线性模型等模型提供拟合优度检验。该方法采用“hunt-and-test”策略,利用机器学习识别经验得分中有希望的方向,然后检验其显著性,并进行去偏校正以提高准确性。该检验能控制I类错误,并在所识别的方向与真实得分一致时显示出功效,其应用已在HIV临床试验…
-
免费“深度R编程”教材发布,面向数据科学和机器学习
一本题为“深度R编程”的综合入门课程已在线上和PDF格式免费提供。该资源旨在使学生、专业人士和研究人员具备独立使用R进行数据整理、分析、数值计算、统计和机器学习的必要技能。该教材是一个非营利项目,最新版本于2026年7月30日提交。
-
AI编程工具七月效率提升
七月对于AI驱动的编程工具的进步来说,是意义重大的一月。这些工具旨在提高开发人员在使用R和Python等语言时的效率。更多详情请参阅统计新闻中心。
-
机器学习工程师面试准备:CI/CD、Kafka、Kubernetes
此条目是关于机器学习工程师职位的技术面试题的请求,特别关注 CI/CD、Apache Kafka 和 Kubernetes。用户正在寻求有关直播部署面试的准备建议。
-
新的R包BKP为概率曲面提供高级统计建模
一个名为BKP的新R包已被开发出来,用于从各种类型的响应数据中估计输入依赖的概率曲面。该包实现了Beta核过程(BKP)和Dirichlet核过程(DKP)模型,这些模型利用核加权伪计数聚合和beta-二项共轭来实现闭式后验摘要。BKP包还包括可扩展的近似方法,适用于更大的数据集,并支持证据借用、自适应先验和超参数调优等功能。演示的应用包括概率曲面估计、分类以及用于疾病流行度绘图和物种分布建模的实际数据分析。
-
新的 R 包 'nnmf' 提供了非负矩阵分解的性能比较
一个名为 nnmf 的新 R 包已被开发用于非负矩阵分解 (NMF),这是一种用于降维的技术,广泛应用于生物信息学、文本挖掘和图像分析等领域。本研究介绍了该包,并提供了与两个现有的 NMF R 包的性能比较。评估使用了真实世界的数据来评估计算效率、收敛性、准确性和稳定性,旨在为研究人员提供选择合适 NMF 工具的客观指导。
-
新的 R 包 `cayleyR` 使用图论解决排列难题
研究人员开发了 `cayleyR`,这是一个 R 包,旨在通过分析 Cayley 图中的循环交集来解决排列难题。该包采用迭代双向搜索算法,从初始状态和目标状态生成循环,并通过它们的交集找到路径。它专门针对 TopSpin(n,k) 谜题,利用对称群 Sn 的 Cayley 图表示的状态空间。该实现集成了 C++ 进行状态存储,并提供可选的 Vulkan GPU 加速,该软件现已在 CRAN 上提供。
-
ML用户就分割模型的图像增强寻求建议
r/MachineLearning上的一位用户正在就训练单类别分割模型的即时增强的最佳数量寻求建议。他们拥有一个包含3000张艺术品图像的数据集,并担心光照、视角和相机角度的变化。用户正在争论每张图片100种增强组合是否过多,并正在考虑不同的增强策略,优先考虑分割准确性而非速度。