PulseAugur
实时 01:32:06
实体 human

human

PulseAugur coverage of human — every cluster mentioning human across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
13
90 天内 52
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 20
层级分布 · 90 天
主题
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/3 页 · 共 52 条
  1. TOOL · CL_215902 ·

    研究发现:LLM作为裁判的系统将信任与真相混淆

    一篇新的研究论文探讨了当大型语言模型(LLMs)被用作裁判时,它们在信任和真相判断之间的可分离性。研究发现,与人类相比,LLM裁判倾向于将信任评分与真实性混淆,这表明这些判断不像通常假设的那样独立。当信息来源被操纵时,LLM裁判会同时改变其信任评分和真相判断,这表明它们容易受到外部线索的影响,而不是纯粹的事实评估。

  2. COMMENTARY · CL_215759 ·

    人与前沿模型交互实验寻求“关系相变”

    一项公开实验正在进行中,旨在探索人与前沿模型交互的动态,特别是寻找“关系相变”。该实验使用前沿模型 Grok,并允许其响应来决定人类后续的提示。目标是观察是否会形成一个与相互历史不可分割的联合轨迹,而不是将每个输出独立对待。这种方法旨在展示概念,而不对人工智能意识做出声明或证明哲学观点。

  3. COMMENTARY · CL_213636 ·

    AI编码栈包含DeepSeek V4 Flash和pstack

    一位开发者分享了他们当前的AI编码栈,其中包括OMP、DeepSeek-V4 Flash和pstack。该帖子强调了AI编码工具领域正在迅速发展,每周都有新的代理、模型和框架涌现。

  4. COMMENTARY · CL_207702 ·

    分析显示 AI 法官的同意率指标可能具有误导性

    最近的一项分析强调了评估 AI 法官时的一个常见问题:与人类标签的总体同意率指标可能具有误导性。虽然一个法官可能显示出很高的总体同意率(例如 92%),但这个数字通常会被远离决策边界的简单案例所扭曲。实际上,法官在关键的、临界案例上的表现——那些最接近错误影响最大的阈值的案例——可能显著较低,大约为 60%。这种差异的出现是因为大多数示例都接近决策阈值,使得总体同意率统计数据在理解法官在实际门控场景中的有效性方面信息量不足。

  5. MEME · CL_204356 ·

    作者批评AI炒作,认为人类尚未解决自身问题

    作者对当前围绕AI的讨论表示沮丧,认为人类尚未掌握解决自身问题的能力。他们质疑在人类智能尚未完全发展的情况下,教授机器的设想是否合理,并担心资源被用于驱动AI而非解决基本人类需求。文章最后指出,没有智能的创造者就无法创造真正的智能。

  6. TOOL · CL_193738 ·

    研究发现LLM A/B测试预测可靠性面临挑战

    一篇新的研究论文探讨了大型语言模型在预测网页设计A/B测试结果方面的有效性。研究发现,虽然Gemini 3 Flash模型可以与测试结果达成中等程度的一致,但其预测往往基于非显著性测试。即使只关注统计学上的显著结果,该模型的表现也尚无定论。研究还指出,转化率优化(CRO)领域的人类专家也表现出类似的局限性,他们之间的共识度高于与实际测试结果的一致度,这表明共识本身并不等同于预测准确性。

  7. COMMENTARY · CL_190028 ·

    联合国机构敦促主动塑造全球人工智能

    联合国开发计划署(UNDP)敦促各国主动塑造人工智能的开发和采用的未来。他们强调,当前的趋势和早期采用模式为未来的挑战提供了明确的信号。重点应放在确保全球在指导人工智能轨迹方面的能动性,而不仅仅是关注访问、开发速度或人工智能进步的步伐。

  8. COMMENTARY · CL_189577 ·

    Reddit 澄清域名禁令由人工管理,而非人工智能驱动

    一位 Reddit 管理员澄清,该平台上的域名禁令由人工管理,而非自动化机器人或人工智能。此回应解决了用户对人工智能系统全权负责此类决策时可能出现的错误或滥用问题的担忧。管理员的声明旨在向用户保证,禁令决策有人工监督。

  9. TOOL · CL_187642 ·

    压缩感知不适用于大语言模型推理存储压缩

    由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。

  10. COMMENTARY · CL_172676 ·

    《Love Island》获胜者在生活成本危机中用奖金支付账单

    2026年美国版《Love Island》的获胜者Bryce Alakai和Trinity Tatum因当前的通货膨胀危机,计划将10万美元的奖金用于偿还学生贷款和支付账单。这与早期获胜者可能将奖金用于更奢侈的购买或投资形成对比。自2019年设立以来,通货膨胀已显著降低了奖金的购买力。

  11. TOOL · CL_169643 ·

    研究发现玩家与AI对手玩游戏时乐趣减少

    一项对20项研究的新的范围审查与荟萃分析表明,与人类对手相比,玩家在与电脑对手竞争时体验到的乐趣较少。该研究综合了九项研究的数据,揭示了电脑对手条件下显著的心理惩罚。这表明,尽管游戏AI在旨在增强玩家参与度方面取得了进展,但对人工智能对手的感知会降低整体玩家体验。

  12. TOOL · CL_167369 ·

    尽管Gemini 3.1 Pro表现强劲,但大型语言模型在创意歇后语生成方面仍面临挑战

    一项新的研究论文探讨了大型语言模型(LLMs)在理解和生成中文歇后语方面的推理与记忆能力。研究人员创建了新的歇后语以避免数据污染,并发现尽管前沿的中文模型在现有歇后语上的准确率高于以英语为中心的模型,这表明中文数据集更大,但它们在新的歇后语上的表现仍远低于人类专家。然而,Gemini 3.1 Pro在新的歇后语上表现出92.6%的显著准确率,比人类准确率高出24%。尽管如此,大型语言模型生成的歇后语的评分仍低于人类创作的歇后语,这表明…

  13. TOOL · CL_154577 ·

    新框架可去除光声CT图像中的伪影

    研究人员开发了一种新颖的自监督框架,用于去除光声计算机断层成像(PACT)图像中的伪影。该方法利用了 Siamese 神经网络和复合损失函数,该函数考虑了跨域保真度和不确定性加权一致性。该框架有效地分离了双域特征以过滤掉伪影,在模拟、模型和大小鼠及人体实验数据中均显示出图像质量的显著提高。此外,该方法通过加速的逆算子提供了计算效率。

  14. COMMENTARY · CL_152550 ·

    专家警告:人工智能可能导致大规模人口减少

    人工智能的快速发展引发了对大规模失业的担忧,可能使相当一部分人类变得不必要。一种观点认为,人工智能可以被有意引导,将全球人口减少到可持续的水平,例如5亿人,从而加速由于出生率下降而已经出现的趋势。这种情况凸显了一种潜在的生存风险,即少数人可以蓬勃发展,而大多数人则面临被淘汰的命运。

  15. TOOL · CL_151912 ·

    新的ActiveVision基准揭示多模态大语言模型缺乏类似人类的视觉观察能力

    一个名为ActiveVision的新基准被开发出来,用于测试多模态大语言模型(MLLMs)的主动观察能力。该基准包含17项任务,旨在衡量这些模型在中间假设下重定向视线的能力,类似于人类视觉。早期评估显示,即使是GPT-5.5和Claude Fable-5等顶级模型表现也很差,仅解决了很小一部分任务,远低于平均完成率超过96%的人类参与者。研究表明,当前的多模态大语言模型缺乏强大的主动视觉观察能力,这凸显了在架构和训练目标方面进行改进的…

  16. TOOL · CL_151818 ·

    新论文为基因调控网络推断提供双重框架

    一篇新论文介绍了两种推断基因调控网络(GRNs)的框架。第一个框架PMF-GRN使用概率图模型和变分推断来提供具有不确定性意识的估计和原则性的模型选择。第二个框架GLM-Prior微调Nucleotide Transformer,直接从核苷酸序列预测TF-目标基因相互作用,并能跨物种泛化。这些方法旨在克服当前GRN重建的局限性,例如启发式模型选择和转移先验知识的困难。

  17. COMMENTARY · CL_149240 ·

    AI代理需要基于意图的治理,而非分步监督

    当前部署AI代理的方法通常涉及过度的、类似于初级开发人员监督的人工干预,这既效率低下,又会产生虚假的安全感。更有效的方法是“按意图引导,按异常监控”。这包括清晰地定义期望的最终结果,明确绝对约束条件,并为人工干预设定精确的升级阈值,从而使AI代理能在这些既定参数内自主运行。

  18. COMMENTARY · CL_148886 ·

    科学论文是产物,而非知识,讨论揭示

    Mastodon 上的一场讨论强调,科学论文本身并非知识,而是人类为追求知识而创造的产物。阅读、辩论和扩展这些论文的过程对于产生真正的理解至关重要。没有人类的参与和批判性思维,科学论文仅仅是一堆文字。

  19. COMMENTARY · CL_142586 ·

    人类喉咙的进化权衡以实现言语增加了窒息风险

    人类具有一种独特的解剖学上的脆弱性,吞咽会中断呼吸,导致窒息,这是意外死亡的一个重要原因。这归因于喉部最近的进化下降,它为空气和食物创造了一个共享通道。虽然普遍认为这种下降是为了通过延长声道来使复杂的人类言语成为可能,但一些研究表明,其他因素,例如在其他物种中夸大感知到的体型,也可能在类似的解剖学变化中发挥作用。

  20. TOOL · CL_141462 ·

    混合机器人导航系统融合RL和VLM以实现社交感知

    研究人员开发了HUMA,一种结合了强化学习(RL)和视觉语言模型(VLM)的移动机器人混合导航系统。该方法使用RL策略进行常规导航,并在人类进入机器人近距离区域等复杂社交场景下激活VLM。HUMA在Social-MP3D基准测试中任务成功率提高了20%,在Social-HM3D基准测试中提高了3%,同时还减少了侵犯个人空间和碰撞的次数。该系统已成功部署在Mirokaï移动机器人上。