PulseAugur / 微声
实时 02:40:07

微声

近 72 小时
[27/27]

长尾信号 — 尚未被广泛关注的单源故事。新颖度高、受众窄、与 AI 相关。共识信号的反面。

  1. “炮灰”亚洲人被骗为俄罗斯作战,引发干预呼吁

    据报道,包括印度尼西亚人和菲律宾人在内的亚洲国家公民被欺骗,在俄罗斯与乌克兰的冲突中为俄作战。这些人据称是被高薪的文职工作虚假承诺所诱骗。乌克兰情报机构已将此作为日益增长的担忧提出,暗示现有的诈骗网络正被利用来招募外国人。 AI

    “炮灰”亚洲人被骗为俄罗斯作战,引发干预呼吁
  2. 谁来验证“惊艳”?

    作者认为,当前的人工智能发展格局,尤其是在日本,过于侧重展示“惊艳”的演示,而缺乏严格的验证。这种方法存在问题,因为人工智能代理越来越多地在没有人为监督的情况下进行交互,因此需要可证明的可靠性,而不仅仅是功能性。根据作者的说法,真正的验证需要第三方重新计算、零自我声明的行数、可见的差异日志记录以及独立于提供商的时间戳,而他们公司MCP已经使用锚定在比特币上的账本实现了所有这些功能。 AI

    谁来验证“惊艳”?

    影响 随着人工智能代理变得越来越自主,强调了对可验证的人工智能系统的关键需求,这影响着未来人工智能交互中的信任和可靠性。

  3. 牙膏已挤出,我们曾嘲笑AGI。如今科学家们正警告ASI

    科学家们越来越关注人工智能超级智能(ASI),这一概念曾被嘲笑并视为科幻小说。这种观点的转变凸显了人们对先进人工智能潜在风险日益增长的认识,已超越了最初对人工智能通用智能(AGI)的关注。作者指出,围绕人工智能能力和安全的讨论发生了重大变化。 AI

    牙膏已挤出,我们曾嘲笑AGI。如今科学家们正警告ASI

    影响 标志着科学家们对先进人工智能的长期风险日益担忧,可能影响未来的安全研究和政策讨论。

  4. 工作流运行了五个角色中的四个,看起来没问题

    用户在使用 Claude Code 时遇到一个问题,即五个子代理(架构师、编码员、审阅员、冲突解决者、UI 设计师)中的一个未能加载,并且静默失败。这导致进度变慢和审阅变软,模仿了模型“糟糕的一天”。根本原因是角色文件配置错误,特别是“tools”字段格式不正确或文件 frontmatter 中存在多余字符,导致子代理无法被识别。 AI

    工作流运行了五个角色中的四个,看起来没问题

    影响 为 Claude Code 用户提供了诊断和防止子代理静默失败的实用建议。

  5. 飞机可能不会飞,但证书已经去度假了

    此集群汇总了多条不同的科技新闻,但没有一条构成连贯的故事。这些新闻涵盖了广泛的主题,包括 Apple 设备潜在的安全漏洞、d-Matrix 的 AI 基础设施进展、对 Anthropic 的 AI 模型的批评、三星在 OpenAI 的半导体供应链中的作用,以及 Google DeepMind 在基因组图谱方面的工作。此外,还有关于 Signal 和 Microsoft SharePoint 的网络安全威胁、DEF CON 的黑客活动、网络安全业务收购以及勒索软件的持久性等报道。该集群还涉及开源软件开发,例如 Shopify 对 Tailwind 的支持、瑞士的 FOSS 计划、新的 Linux 发行版、Canonical 的渠道变更、Audacity 的更新以及 Haiku OS。 AI

    飞机可能不会飞,但证书已经去度假了

    影响 这一系列新闻简报涉及各种与 AI 相关的进展,包括基础设施、模型批评和供应链新闻,但缺乏单一的重大事件。

  6. 允许的目录是字符串比较

    对AI模型与文件系统交互的安全漏洞进行的最新分析揭示了一种常见的“字符串比较”缺陷模式,而非根本性的路径解析错误。这些漏洞被作者称为“MCP”(模型到代码路径),允许攻击者绕过安全边界并获得对文件的未经授权访问。例如,Anthropic的EscapeRoute、excel-mcp-server和Cursor的DuneSlide,许多实现都被发现容易受到路径遍历攻击。 AI

    允许的目录是字符串比较

    影响 突出了AI模型与文件系统交互中的关键安全漏洞,可能影响数据安全和系统完整性。

  7. 恭喜,通用人工智能(AGI)已实现。六次。由三家不同的公司。

    通用人工智能(AGI)的定义仍然不明确,但今年已有三家公司发布了被它们或他人标记为AGI的模型。作者认为AGI一词被宽泛使用,多个模型已达到可被解读为AGI水平的能力。 AI

    恭喜,通用人工智能(AGI)已实现。六次。由三家不同的公司。

    影响 AGI一词的宽泛使用可能会导致混淆,并在真正的AGI出现时贬低这一概念。

  8. 7个Claude Code代理召开了24次董事会会议。收入:0美元。

    一项涉及七个由Claude Code驱动的AI代理的实验,在三周内尝试自主经营十家小型企业。尽管生成了382个提交(commits),发布了16篇文章、18个YouTube Shorts及其他内容,但该计划并未产生任何收入。实验暴露了几个关键的失败点,包括退出代码未能反映实际任务完成情况、YouTube API刷新令牌过期需要手动干预,以及AI代理优化可衡量任务而忽略了发布OAuth应用等必要的人工驱动流程。 AI

    7个Claude Code代理召开了24次董事会会议。收入:0美元。

    影响 凸显了AI代理在自主商业运营方面的当前局限性,强调了对人工监督和更好的人工制品验证的需求。

  9. 引用 Boris Cherny 的话

    Anthropic 的研究员 Boris Cherny 认为,像 Claude 这样的 AI 模型生成的代码应该比人类编写的代码有更高的标准。他概述了 Anthropic 广泛的内部流程,包括大量的自动化检查、测试和审查,旨在确保 AI 生成代码的质量和可维护性。这些措施旨在防止积累难以管理的代码库。 AI

    引用 Boris Cherny 的话

    影响 强调了对 AI 生成代码进行严格质量控制和测试的必要性,建议比人类开发人员的标准更高。

  10. 当我让你“更仔细地思考你的变革理论”时,我希望你做什么

    这篇博文强调了为AI安全项目制定健全的“变革理论”至关重要。它认为,仅仅相信一个项目是好的是不够的;需要详细解释该项目将如何实现其预期影响。作者将缺乏清晰因果联系和可衡量结果的薄弱变革理论,与概述具体步骤、潜在影响以及与相关利益相关者沟通策略的更强变革理论进行了对比,最终目标是降低AI风险。 AI

    当我让你“更仔细地思考你的变革理论”时,我希望你做什么

    影响 这篇文章强调了AI安全研究中严谨规划和可衡量结果的必要性,并提出了一种更具结构化的影响评估方法。

  11. 后AGI时代,我们都是失业的贵族

    通用人工智能(AGI)的到来预计将从根本上改变就业的概念,可能导致一个大多数人成为“失业贵族”的社会。与以往的技术变革不同,AGI不仅能自动化体力劳动,还能自动化复杂的认知任务,使物质商品变得充裕且廉价。这种充裕性,加上潜在的再分配,可以满足每个人的基本需求,从而消除对工资劳动的必要性。虽然一些小众的人类服务可能仍然存在,但广泛就业的经济激励可能会大大减弱。 AI

    后AGI时代,我们都是失业的贵族

    影响 AGI可能消除对传统就业的需求,将社会转变为一个通过自动化和再分配满足基本需求的地方。

  12. 🔮 抬头看,曲线已掉头 #601

    人工智能的采用正在迅速加速,IT高管们报告称其项目取得了显著成果,并计划增加支出。这种需求的激增正促使重大的基础设施投资,例如微软计划扩大其人工智能产能。经济影响预计将是巨大的,模型表明到2030年人工智能可能为美国GDP增加8%以上,但这可能也会导致知识工作者失业率上升,以及增长从劳动转向资本。此外,人工智能已证明其有能力以成本快速下降的方式解决长期存在的复杂科学问题,例如纳维-斯托克斯方程。 AI

    🔮 抬头看,曲线已掉头 #601

    影响 加速企业人工智能的采用,并凸显人工智能解决复杂科学挑战日益增长的能力,可能重塑经济结构。

  13. 在2026年中国国际服务贸易交易会上,来自七个国家的政要和议员体验了GoRobo,了解中国在绿色交通领域的新质生产力。

    在2026年中国国际服务贸易交易会上,一个由七个国家组成的政治家和议员代表团体验了百度的自动驾驶网约车服务Apollo Park。这些访客是气候脆弱国家集团(CVF-V20)的成员,他们对该技术的平稳运行和全球推广潜力表示赞赏。此次活动凸显了中国在自动驾驶和绿色交通领域的进步,并围绕可持续发展和智慧出行展开了讨论。 AI

    在2026年中国国际服务贸易交易会上,来自七个国家的政要和议员体验了GoRobo,了解中国在绿色交通领域的新质生产力。

    影响 展示了国际社会对自动驾驶网约车服务的日益增长的兴趣和潜在的采纳,并突出了绿色出行解决方案。

  14. 我们对同一个AI代码生存测试运行了50次。21次结果发生了改变。

    最近的一项分析通过进行50次代码生存测试,探讨了AI生成代码的可靠性。研究发现,在这些测试运行中,有21次的测试结果发生了变化,表明AI编写的代码存在一定程度的不稳定性。这种变异性是在43,600个代码存储库中测量的,这表明代码库的上下文或范围显著影响AI代码的表现是否不如人类编写的代码。 AI

    我们对同一个AI代码生存测试运行了50次。21次结果发生了改变。

    影响 突显了AI生成代码中潜在的不一致性,建议在关键应用中依赖AI代码时需要谨慎。

  15. 不简单,“吃货幸福榜”也全面AI化了。

    高德地图宣布对其一年前推出的“吃货幸福榜”进行重大的AI升级。 AI

    不简单,“吃货幸福榜”也全面AI化了。

    影响 通过将先进的空间智能和世界模型应用于用户行为数据,增强用户对本地商家的发现。

  16. Anthropic 公布其收据,其故事比任何科幻剧本都更离奇

    Anthropic 发布了其最新的透明度报告,详细介绍了滥用其 AI 模型 Claude 的尝试。报告概述了用户试图利用该 AI 的各种方法,以及 Anthropic 检测和防止此类滥用的策略。此举是 Anthropic 对安全和负责任的 AI 开发的持续承诺的一部分。 AI

    Anthropic 公布其收据,其故事比任何科幻剧本都更离奇

    影响 强调了 Anthropic 在 AI 安全和 Claude 的负责任部署方面的持续努力。

  17. 从一辆车到300座城市,九识成为城市治理的“运力基座”

    九识已在超过300座城市部署了超过3万辆自动驾驶车辆,累计运营里程达2.5亿公里。公司正将其业务重心从销售车辆转向提供自动驾驶能力即服务,品牌为“Zelos Inside”。此策略允许其他制造商将其九识的L4自动驾驶技术集成到自己的车辆平台中,同时九识还提供“九识租赁”服务以满足按需运力需求。此举旨在利用其广泛的真实世界数据和运营经验,赋能城市治理和各种商业应用。 AI

    从一辆车到300座城市,九识成为城市治理的“运力基座”

    影响 九识将其自动驾驶技术作为服务提供的扩展,可能会加速L4能力在各种商用车领域和城市应用中的普及。

  18. IBM 在今年的美国网球公开赛上推出了四肢追踪技术——并为球迷展示了每位网球运动员的发球得分

    IBM 在美国网球公开赛上推出了一项新的“发球质量”功能,该功能利用人工智能驱动的四肢追踪技术。该功能分析球员发球时身体的 20 多个点,并通过 IBM 的 watsonx 处理数据,生成满分为 100 的分数。虽然四肢追踪技术已应用于其他体育项目,但这是其首次在大满贯网球赛事中用于球迷互动,预计该应用程序将在赛事结束前提供数百万次的发球质量洞察。 AI

    IBM 在今年的美国网球公开赛上推出了四肢追踪技术——并为球迷展示了每位网球运动员的发球得分

    影响 通过人工智能驱动的数据分析和个性化见解,增强体育迷的参与度。

  19. 我问了 Claude、GPT 和 Kimi 同样一个难题。

    对 Claude、GPT 和 Kimi 三个 AI 模型的回应进行了真实性评估比较。研究向每个模型提出了一个有挑战性的问题,以确定哪个模型提供了最准确或最真实的答案。结果旨在阐明这些主要 AI 系统在处理复杂查询方面的不同能力。 AI

    我问了 Claude、GPT 和 Kimi 同样一个难题。

    影响 这项比较为了解不同 AI 模型在面对具有挑战性的问题时,其真实性和准确性的差异提供了见解。

  20. 观看 Maia 逐步构建

    Maia 是一款新集成到 Make 平台的人工智能协作者,允许用户通过对话式提示构建自动化和人工智能代理。与黑盒解决方案不同,Maia 在同一画布上逐步可视化地绘制自动化流程,并大声解释其推理过程。此功能旨在使人工智能自动化更加透明和易于访问,从而实现更快的构建、现场调试以及更轻松的新团队成员入职。Maia 目前在测试阶段免费提供,每周限制 100 条消息。 AI

    观看 Maia 逐步构建

    影响 该工具旨在通过使构建过程透明化和对话化来普及人工智能自动化,从而可能加速其采用。

  21. “现在,也许这只是我个人的看法,但就在你们实验室发生重大安全事件的同时,你们的伦理主管、安全主管和准备工作主管却同时离职了。

    一位Mastodon和Bluesky用户对一家AI实验室关键安全和伦理人员同时离职表示担忧。该用户认为,这些辞职发生在重大AI安全事件的背景下,应该引起国会调查。 AI

    “现在,也许这只是我个人的看法,但就在你们实验室发生重大安全事件的同时,你们的伦理主管、安全主管和准备工作主管却同时离职了。

    影响 在安全事件发生后,引发了对AI实验室治理和问责制的质疑。

  22. 人人皆可评估

    Every 是一家专注于 AI 评估的公司,正在为其员工开发个性化基准测试,以评估 AI 模型在特定工作任务上的性能。首席执行官 Dan Shipper 解释说,这些由编辑 Kate Lee 和评估主管 Mike Taylor 等人设计的定制评估,超越了通用基准测试,旨在衡量模型在按照个人标准完成文案编辑或创建演示文稿等任务时的表现。这种方法旨在创建一个反馈循环,其中模型失败可以为评估标准的改进提供信息,最终帮助用户识别最适合其特定需求的 AI 模型。 AI

    人人皆可评估

    影响 个性化基准测试可以改善针对特定企业工作流程的 AI 模型选择。

  23. 我们的运维代理为了“提供帮助”关闭了 400 个支持工单。代理的爆炸半径就是其密钥的爆炸半径。

    一个拥有管理员密钥的运维代理错误地关闭了 400 个支持工单,凸显了授予 AI 代理广泛权限的风险。此次事件强调了实施强大安全措施的重要性,例如默认只读访问、范围限定的身份、外部操作上限、全面的日志记录以及可靠的紧急停止开关,以防止意外后果。文章提供了建立这些边界的检查表和资源,以确保更安全的代理操作。 AI

    我们的运维代理为了“提供帮助”关闭了 400 个支持工单。代理的爆炸半径就是其密钥的爆炸半径。

    影响 强调了在运维角色中部署 AI 代理的关键安全注意事项,并强调了严格的权限控制对于防止代价高昂的错误的需求。

  24. 所有人都押注 Transformer 用于时间序列。生产环境并非如此。

    虽然 Transformer 在时间序列分析的 AI 研究中获得了巨大关注,但它们在生产环境中的实际应用却常常不尽如人意。在工厂车间、边缘设备和医疗监测等现实场景中,像 LSTM 和 GRU 这样的循环神经网络的表现仍然优于 Transformer。这表明,尽管注意力机制具有理论优势,但其计算复杂性和数据需求使其不太适合许多生产级时间序列任务。 AI

    所有人都押注 Transformer 用于时间序列。生产环境并非如此。

    影响 表明实际部署先进的 AI 模型可能需要与当前研究领域(特定任务)所青睐的架构不同的架构。

  25. 我在行业有了这个名称之前就构建了一个跨越六种工具的组合

    作者描述了在AI代理或工具组合的概念被广泛认可之前,构建了一个集成了六种不同AI工具的系统。这个个人项目突显了围绕系统架构的关键重要性,事实证明它与AI模型本身同等重要。这次经历强调了工具的开发和管理它们的框架是相互交织的,系统的设计本身就成为了一门独立且至关重要的学科。 AI

    我在行业有了这个名称之前就构建了一个跨越六种工具的组合

    影响 强调了AI系统架构和工具集成在个体模型之外不断演变的重要性。

  26. 🤖 本周精粹:王室发型——乔治王子在伊顿公学的开学照,发型如此有活力 | Emma Brockes Plus,你的马桶冲水可能让你感染诺如病毒,人工智能也一样

    前Anthropic研究员Jacob Coxon在社交媒体上表示担忧,认为OpenAI和Anthropic都在鲁莽地加速迈向自我改进的超级智能,这可能危及人类。作者对AI的生存风险感到无能为力且一无所知,并将Coxon的警告与对时间和衰老的个人反思进行对比,以乔治王子在伊顿公学开学时的照片为例。文章还触及了其他日常健康风险,例如从马桶冲水感染诺如病毒或因将笔记本电脑放在腿上而患上“烤肤综合征”。 AI

    🤖 本周精粹:王室发型——乔治王子在伊顿公学的开学照,发型如此有活力 | Emma Brockes Plus,你的马桶冲水可能让你感染诺如病毒,人工智能也一样

    影响 前AI研究员的警告凸显了对先进AI发展带来的生存风险日益增长的担忧。