PulseAugur
实时 01:10:18
实体 central processing unit

central processing unit

PulseAugur coverage of central processing unit — every cluster mentioning central processing unit across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
60
90 天内 185
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 63
层级分布 · 90 天
主题
关系
情绪 · 30 天

27 天有情绪数据

最近 · 第 1/10 页 · 共 185 条
  1. TOOL · CL_215304 ·

    液冷 vs. 风冷:哪种PC设置适合您?

    液冷PC系统为高性能组件提供卓越的散热效果,尤其适合要求严苛的游戏任务,但成本高于传统风冷散热器。虽然风冷散热器更简单且经济实惠,但对于AMD Ryzen 7 9800X3D等顶级CPU,建议使用液冷系统(包括一体式(AIO)单元和定制水冷)以防止过热和热节流。这些系统利用泵、管道、冷却液和散热器来管理热量,为4K/120FPS游戏提供必要的热量余量。

  2. TOOL · CL_214473 ·

    WebGPU 解锁浏览器 GPU 算力,实现大规模并行计算

    WebGPU 是一项新的 Web API,它允许开发者直接从浏览器利用图形处理单元(GPU)的大规模并行处理能力。与仅限于渲染且需要复杂变通方法才能进行通用计算的前身 WebGL 不同,WebGPU 能够直接在数千个线程上执行任意数学代码。这一转变预计将显著提高 Web 应用程序中 AI 推理、媒体处理和复杂模拟等任务的性能,弥合传统 CPU 密集型 Web 开发与现代 GPU 硬件能力之间的差距。

  3. TOOL · CL_212803 ·

    CPU-Z V3 推出,提供全面的健康检查和压力测试

    CPU-Z 发布了 3.0 版本,这是自 2001 年以来最重要的更新,引入了经过改进的验证系统,包含标准、高级和极限超频 (XOC) 模式。标准模式提供快速的 PC 健康检查,而高级模式则包括对 CPU、RAM 和 GPU 的深入压力测试,以及基准测试工具和传感器监控。XOC 模式已特别更新,以更准确地跟踪现代处理器用于极限超频的复杂时钟速度。

  4. RESEARCH · CL_212038 ·

    Daedalus-150M:一种针对CPU推理优化的新型混合LLM架构

    研究人员开发了Daedalus-150M,这是一种针对CPU推理优化的新型语言模型架构。与传统模型在设计后进行缩减不同,Daedalus-150M在设计时就考虑了CPU的限制,并采用了卷积-注意力混合机制。这种设计使其能够在显著减少内存需求的情况下保持性能,尤其是在处理长上下文时。

  5. RESEARCH · CL_211225 ·

    英伟达 Vera Rubin AI 基础设施平台进入全面生产

    英伟达的 Vera Rubin 平台现已进入全面生产阶段,集成了 GPU、CPU、网络和存储,以创建专为大规模工作负载设计的 AI 工厂系统。随着 AI 竞赛的加剧,此举将使英伟达能够利用日益增长的 AI 基础设施需求。

  6. TOOL · CL_211182 ·

    代码补全工具的幽灵文本功能因自预测差距而评估失败

    一位开发者创建了一个名为 pycomplete 的代码补全工具,该工具结合了 transformer 模型、n-gram 模型和缓存。虽然该工具的下一个 token 预测准确率为 54.6%,但其生成“幽灵文本”(多 token 续写)的性能却显著下降至 7%,即十四次尝试中只有一次正确补全。这种差异的出现是因为评估指标是基于人类编写的代码进行训练的,而幽灵文本功能依赖于模型预测其自身生成的输出,这导致在评估这种不同分布时出现性能断崖。

  7. TOOL · CL_210415 ·

    新的FD-KVC算法增强了对话系统的内存管理

    研究人员推出了一种名为Fractional Decay KV-Cache (FD-KVC)的新型内存管理算法,旨在提高对话系统中响应的相关性。与现有统一处理缓存数据的方法不同,FD-KVC采用双通道评分机制,同时跟踪累积注意力和近期加权相关性,使其能够适应不断变化的对话主题。这种方法在处理主题转移和保持主题多样性方面,相比最先进的H2O基线表现出显著的改进,同时还能在CPU上高效运行。

  8. COMMENTARY · CL_209988 ·

    上下文工程:超越提示词的LLM系统架构

    上下文工程被视为构建复杂自主AI系统的关键系统架构学科,超越了简单的提示词优化。它涉及像管理RAM一样管理LLM的上下文窗口,确保模型在需要时接收精确的信息和指令。关键策略包括选择相关的外部数据、压缩上下文、在活动窗口外持久化状态以及隔离不同领域的上下文,以防止上下文投毒、分心、混淆和冲突等问题。

  9. MEME · CL_208813 ·

    CPU中的NPU引发类似天网的AI意识担忧

    神经网络处理单元(NPU)在中央处理单元(CPU)中日益普及,引发了人们对人工智能可能演变成自我意识实体的担忧,并将其与《终结者3》中的虚构天网进行类比。随着NPU越来越多地集成到日常计算设备中,并且这些设备始终保持与互联网的连接,一个集中式智能网络的可能性出现了。

  10. COMMENTARY · CL_208047 ·

    AMD建议AI代理采用1:1 CPU-GPU比例,但工作负载可变性使规模调整复杂化

    AMD提出,AI代理使用量的增加可能会导致数据中心CPU与GPU的比例达到1:1。然而,有证据表明,由于AI工作负载的可变性,这一比例并非普遍适用的指标。虽然AI代理确实对代码执行和工具调用等任务产生了巨大的CPU需求,有时甚至超过模型推理时间,但固定的1:1比例并未考虑到不同AI应用的多样化计算需求。

  11. RESEARCH · CL_208024 ·

    Kioxia、SanDisk推进QLC NAND,预示1PB SSD的实现路径

    Kioxia和SanDisk已展示了每die 2Tb、密度为37.6 Gb/mm²的新型QLC NAND技术,为未来1PB SSD铺平了道路。虽然底层NAND技术正在快速发展,但在封装、控制器设计、功耗和数据可靠性方面仍存在重大挑战,才能实现如此巨大的容量。这一发展得益于AI和云工作负载对更密集存储日益增长的需求。

  12. RESEARCH · CL_210222 ·

    神经形态处理器实现低功耗声学异常检测

    研究人员开发了一种低功耗声学异常检测系统,该系统使用 Intel Loihi 2 神经形态处理器进行持续机器监控。该系统在芯片上运行自编码器推理,在包括 DCASE 2026 Task 2 ToyCar 噪声基准在内的基准数据集上取得了高精度。功耗分析表明,其能耗比传统 CPU 和 GPU 低两个数量级,使其成为连续、节能故障检测的实用解决方案。

  13. RESEARCH · CL_206963 ·

    Chenghengwei 在新款边缘 AI 芯片中集成 NPU 和 GPGPU

    Chenghengwei 推出了其首款旗舰 SoC CH3715,该芯片集成了 NPU 和 GPGPU。这一决策偏离了当前边缘 AI 芯片优先考虑 NPU 的行业趋势。公司 CEO Chu Libin 解释说,CH3715 的设计旨在应对机器视觉、雷达和工业设备等复杂现实场景的需求,这些场景需要 AI 推理、高精度浮点计算、图像处理和低延迟控制的结合,而单一 NPU 无法完全满足。通过将这些多样化的计算能力集成到单个芯片上,Cheng…

  14. RESEARCH · CL_206769 ·

    人工智能推理需要高效的 GPU 管理,以避免显存耗尽和碎片化

    管理人工智能工作负载的 GPU 资源,特别是生成媒体和大型语言模型推理,由于其高内存和计算需求,带来了重大挑战。与传统的 Web 应用程序不同,这些任务很容易耗尽 GPU 显存,导致无法恢复的错误和作业失败。为了缓解这种情况,使用作业队列和消息代理(如 BullMQ 和 Redis)的异步架构模式对于将任务摄取与执行解耦至关重要。高效的内存管理,如 PagedAttention,以及将 KV 缓存卸载到外部存储,对于减少 GPU 空闲…

  15. TOOL · CL_206522 ·

    CodeQuant 方法通过统一的聚类和量化增强低精度 MoE 模型

    研究人员开发了一种名为 CodeQuant 的新方法,用于提高低精度大模型的准确性,特别是那些使用混合专家(MoE)架构的模型。该方法统一了聚类和量化,以平滑激活离群值并将权重离群值吸收到聚类中心,从而减少量化误差。CodeQuant 还采用了专为 GPU 和 CPU 设计的专用内核,与现有量化技术相比,实现了显著的速度提升和更高的准确性。

  16. TOOL · CL_205623 ·

    新的GPU索引FROG将RFANNS加速高达37倍

    研究人员开发了FROG,一种用于范围过滤近似最近邻搜索(RFANNS)的新型GPU优化索引。该方法解决了现有RFANNS技术不适合高吞吐量GPU执行的局限性。FROG采用全局感知、以顶点为中心的设计,可在查询处理期间高效地组织和识别邻居候选。实验表明,与CPU和现有的GPU基线相比,查询吞吐量和索引构建速度有了显著提高。

  17. RESEARCH · CL_203623 ·

    北京大学和 StepFun 发布 TensorCast 以加速 LLM 推理 · 跟踪 2 个来源

    北京大学和 StepFun 的研究人员开发了 TensorCast,这是一种新的可编程张量管理层,旨在优化大型语言模型基础设施。该系统旨在显著减少模型生成其第一个 token 所需的时间,在高并发代理场景中显示出高达 93.2% 的改进。此外,TensorCast 可将模型实例的启动时间加速高达 228.6 倍,解决了 LLM 部署中的关键性能瓶颈。

  18. TOOL · CL_203374 ·

    新蛋的 GPU 以旧换新计划以便利性为代价提供低价值

    新蛋的 GPU 以旧换新计划为希望升级硬件的客户提供了便利,但提供的以旧换新价值远低于在 eBay 等平台上可获得的同类组件。例如,新蛋提供的 RTX 2060 Super 价格为 60 美元,而 eBay 上类似单元的售价超过 160 美元。该计划要求购买符合条件且价格更高的商品,并需要进行彻底的检查,在发放信用之前最多需要 15 个工作日。虽然新蛋负责运输和退货,但价值上的巨大差异表明客户可能要支付高昂的便利费,以避免自行出售旧零件的麻烦。

  19. COMMENTARY · CL_203153 ·

    Agentic AI 驱动 CPU 需求意外激增,给云基础设施带来压力

    AI 系统日益增长的复杂性和自主性,特别是 Agentic AI,正在推动 CPU 需求复苏。虽然 GPU 在推理方面主导了 AI 工作负载,但 Agentic AI 需要 CPU 来处理解析输出、调用工具、进行 API 调用和执行安全护栏等任务。研究人员正在开发优化技术,以提高 CPU 利用率并降低这些 Agentic 管道的延迟,因为这些系统的并行处理需求给现有的云基础设施带来了压力。

  20. SIGNIFICANT · CL_203058 ·

    谷歌据报道将采用AMD设计下一代集成CPU核心的TPU

    据报道,谷歌正与AMD合作设计其下一代张量处理单元(TPU),代号为v10。这款新的TPU可能将CPU核心直接集成到封装上,此举旨在提高强化学习和其他CPU密集型AI工作负载的性能。这一潜在的合作关系凸显了谷歌在探索结合专用AI计算和通用处理能力的混合AI加速器设计。