PulseAugur
中
实时 07:39:32
实体 Tahoe-100M

Tahoe-100M

PulseAugur coverage of Tahoe-100M — every cluster mentioning Tahoe-100M across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_180669 ·

    LLM-引导的检索提高了分子扰动预测的准确性

    研究人员开发了一种名为LLM-Guided Retrieval (LGR) 的新方法,用于预测分子对药物扰动的反应,这是药物发现中的关键一步。LGR利用大型语言模型来识别和排序先前研究过的相似的药物-细胞系组合。然后汇总这些已识别的反应,以预测新的、未研究过的组合的结果。与现有方法相比,该方法在不同细胞系上的准确性和泛化能力均有所提高,这表明对于零样本分子扰动预测而言,检索质量比复杂的预测模型更重要。

  2. TOOL · CL_154466 ·

    GeneSpeak-FP 模型从细胞反应中检索药物靶点

    研究人员开发了 GeneSpeak-FP,这是一种基于 Transformer 的检索模型,旨在从细胞水平的转录反应中识别潜在的药物靶点和化合物。该模型分析扰动特征,将处理过的细胞与 DMSO 参考进行比较,以生成靶点和分子嵌入的向量。在 Tahoe-100M 数据集上进行评估,GeneSpeak-FP 在封闭库设置中取得了令人鼓舞的结果,证明了其恢复靶点注释和化合物身份的能力。

  3. RESEARCH · CL_128363 ·

    新的分类器鉴别得分 (CDS) 改进了单细胞扰动评估

    研究人员引入了一种名为分类器鉴别得分 (CDS) 的新指标,以更好地评估单细胞扰动数据,尤其是在类别重叠显著的情况下。在这种情况下,传统的按细胞准确率可能会产生误导,正如在 Tahoe-100M 和 Virtual Cell Challenge 数据集上的演示所示,尽管扰动可区分,但模型却停滞不前。CDS 将分类器的概率向量平均到整个种群上以创建配置文件,从而能够在不重新训练模型的情况下更可靠地识别正确的扰动。

  4. TOOL · CL_121505 ·

    新的数据加载器scDataset加速了大规模单细胞组学数据集上的深度学习

    研究人员开发了scDataset,一个PyTorch数据加载器,旨在高效处理用于深度学习的大规模单细胞组学数据集。该工具通过结合块采样和批量获取,解决了加载超出可用内存的海量数据集的挑战。这种方法实现了准随机采样,平衡了I/O效率和最小批次多样性,并在1亿个细胞的数据集上与传统随机采样相比实现了两个数量级以上的加速,同时保持了可比的模型性能。