biomarker
PulseAugur coverage of biomarker — every cluster mentioning biomarker across labs, papers, and developer communities, ranked by signal.
-
寻求用于PDF文本和布局提取的AI模型
一位r/MachineLearning用户正在寻求能够准确提取PDF文本和布局的最新模型推荐。他们已经尝试了包括DocLayout、Docling、MinerU和Marker在内的几种模型,发现虽然Docling表现良好,但它倾向于过度分割内容。MinerU被指出会遗漏关键信息,如通讯作者详细信息和文章类型标签。Unlimited OCR尽管在通用文本提取方面表现强劲,但在样式识别和徽标识别方面存在困难。
-
开发者发布BIOMA LLM内核,从多LLM编排转向
一位开发者发布了BIOMA,一个旨在提高LLM效率和安全性的内核。最初设想为一种编排多个LLM的“有丝分裂”方法,但该策略被证明无效,增加了成本并降低了准确性。开发者转向了BIOMA,一个基于Rust和Python的框架,在将LLM负载发送给Anthropic、Google或OpenAI等提供商之前对其进行加固。BIOMA采用上下文凋亡机制来减少token使用量,一个用于秘密信息 redaction 和洪水检测的认知防火墙,以及一个用…
-
Datalab 的 Lift 9B 模型在 Schema-First PDF 提取方面处于领先地位
Datalab 的 Lift 是一款新推出的拥有 90 亿参数的视觉语言模型,专为 Schema-First 文档提取而设计。与首先将文档解析为中间格式再提取字段的传统方法不同,Lift 旨在一次性直接从 PDF 和图像输出 Schema 形状的 JSON。在 Datalab 自行进行的基准测试中,Lift 的字段准确率达到了 90.2%,高于其最接近的开源竞争对手 NuExtract3 的 81.5%。Lift 被定位为一种专门的工…
-
AI框架通过可解释推理和多模态数据增强青光眼诊断
研究人员开发了先进的青光眼诊断AI框架,旨在改进不透明的深度学习模型。GlaKG利用知识图谱,通过整合生物标志物、临床规则和图像特征来提供可追溯的推理,在分类和风险分层方面实现了高精度。GlaBoost采用多模态梯度提升方法,结合眼底图像嵌入、基于文本的评估和结构化生物标志物,以增强可解释的预测。另一个框架使用带有堆叠集成(stacking ensemble)的Vision Transformer (ViT)来处理眼底图像和临床数据,…
-
量子机器学习混合方法在COPD肌肉结局预测方面显示出前景
研究人员开发了一种新颖的量子机器学习方法,结合了几何和量子核方法,用于预测慢性阻塞性肺疾病(COPD)的骨骼肌结局。这种混合方法通过再生核希尔伯特空间映射合成参考,并使用量子回归电路进行预测。虽然在预测肌肉重量方面比经典方法提高了约1.8%,但在调整后尚未确定统计学显著性。该方法在预测肌肉质量方面也产生了数值上最低的平均RMSE,但经典岭回归在预测肌肉力量方面表现最佳。
-
研究发现PDF转换质量对RAG问答至关重要
一项发表在arXiv上的新研究评估了四个开源PDF到Markdown转换框架在检索增强生成(RAG)系统中对领域特定问答准确性的影响。研究发现,Docling结合分层拆分和图像描述,实现了最高的准确率(94.1%),甚至优于手动整理的Markdown。研究强调,数据准备质量,特别是依赖表格的问题处理和元数据丰富,比单独选择转换框架对RAG性能更为关键。
-
reMarkable 发布 Paper Pure 平板,此前裁员并担忧需求
reMarkable Paper Pure 是一款新的电子墨水书写板,面向新用户和企业市场推出。它配备了 10.3 英寸 E Ink Carta 1300 显示屏、双核 ARM 处理器、2GB 内存和 32GB 存储空间,续航时间长达三周。该设备包含一个无线充电的主动式 Marker 手写笔,并采用强调可修复性和回收材料的设计,但值得注意的是它没有显示屏背光。
-
reMarkable 发布 Paper Pure,其最经济实惠的无干扰数字笔记本
reMarkable 推出了 Paper Pure,这是一款入门级的电子纸平板电脑,专为专注工作和笔记记录而设计。这款新设备旨在复制纸上书写的感受,并包含其高端机型的功能,例如主动式触控笔和改进的显示对比度。Paper Pure 也专为企业用户设计,提供增强的安全功能和日历集成,起价为 399 美元。