PulseAugur
实时 21:24:39
实体 BITNET

BITNET

PulseAugur coverage of BITNET — every cluster mentioning BITNET across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 19
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
时间线
  1. 2026-08-12 product_launch Microsoft open-sourced the BitNet inference framework for 1-bit LLMs. 来源
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/1 页 · 共 19 条
  1. TOOL · CL_214737 ·

    BitNet 探索三元权重,将 LLM 内存减少 10 倍

    研究人员正在探索降低大型语言模型计算和内存需求的方法,而不仅仅是增加模型大小。一种有前途的方法 BitNet,研究在权重限制为三元值(-1、0、+1)的模型上进行训练。该技术将内存需求显著降低了一个数量级,并将昂贵的矩阵乘法转变为简单的加法。Microsoft 已经使用 4 万亿个 token 训练了一个 20 亿参数的 BitNet 模型,证明了其匹配全精度基线性能的潜力。

  2. TOOL · CL_214930 ·

    创客构建7节点ESP32-S3集群以运行3.86亿参数LLM

    一位创客成功构建了一个由七个ESP32-S3微控制器组成的定制集群,以运行一个拥有约3.86亿参数的大型语言模型。这是通过将模型的层分布在各个微控制器上并采用激进的量化技术实现的,包括一种新颖的1.58位三元量化用于权重。该项目在GitHub上进行了详细介绍,使用有线SPI连接进行节点间通信,以降低与无线方法相比的延迟。虽然推理速度很慢,大约每九秒生成一个词,但该项目为在资源受限的硬件上运行LLM提供了一个概念验证。

  3. TOOL · CL_208349 ·

    发布了新的低比特和三元AI模型并更新了性能 · 追踪到1个来源

    已发布并正在追踪几款新的低比特和三元模型,包括Bonsai的1位和1.58位(三元)版本,一款27B参数模型现已在主线后端运行。llama.cpp的更新提高了这些模型的CUDA和Vulkan性能。其他值得注意的发布包括BitCPM-CANN、腾讯的Hy-MT1.5、DeepGrove的Maple-Preview、SyzygyResearch的Mach-1-Additive-35B、FermionResearch的Neutrino-8B…

  4. TOOL · CL_202946 ·

    三元大语言模型随着小型实验室的新模型而复苏

    近期发展表明,三元(1.58位)大语言模型正在复苏,一些小型实验室发布了多个新模型。其中包括prismML的27B三元模型、Deepgrove的20B Maple模型以及Doses AI的27B Pestle模型,后者专门用于医疗应用。虽然这些模型显示出希望,尤其是在速度和特定任务性能方面,但它们目前在长时序代理任务方面面临挑战,开发人员旨在通过未来的强化学习优化来解决这些问题。

  5. TOOL · CL_196524 ·

    微软开源BitNet,用于单CPU上的1比特LLM

    微软已开源BitNet,这是一个为1比特大语言模型(LLM)设计的推理框架。该框架允许在单台CPU上运行多达1000亿参数的模型,无需GPU或云基础设施。虽然框架本身令人印象深刻,但目前发布的模型较小,并且1000亿参数的性能是基于技术报告而非实际可部署的模型。BitNet特别适用于边缘计算、注重隐私的应用以及对高速推理要求不高的场景。

  6. TOOL · CL_189876 ·

    开发者为 BitNet 模型构建零依赖 C 推理引擎

    一位开发者创建了一个专为 BitNet 模型设计的 C 推理引擎,重点关注零依赖和 CPU 性能。该引擎在 Intel Xeon CPU 上运行 BitNet b1.58-2B-4T 模型时,实现了每秒 36.25 个 token 的速度。关键优化包括使用 AVX2/AVX-512 指令的原生三元 SIMD 和高效的线程同步。开发者指出,批量大小为一时,推理速度主要受内存带宽限制,这意味着需要对多个序列进行批处理,以使更快的计算内核能…

  7. COMMENTARY · CL_186836 ·

    作者早期编码历程与当前AI取代担忧相似

    作者回顾了他们早期的编程经历,从七岁时在Mac OS 7上使用AppleScript开始,到八岁时开发自己的编译程序。他们详细讲述了个人经历,包括在罗马尼亚被送入机构,后来被收养到美国,在缅因大学附近长大,他们的母亲在那里从事技术工作。这段叙述将作者母亲在开发软件后因降职而挣扎的经历,与当前工程师面临的威胁进行了类比,因为AI模型的能力越来越强,并对人类开发者的未来角色提出了质疑。

  8. TOOL · CL_174617 ·

    三元量化将超分辨率Transformer压缩至668KB,可在浏览器中使用

    研究人员已成功将BitNet风格的三元量化应用于超分辨率Transformer模型,显著减小了模型尺寸。该量化模型使用-1、0或+1的权重,经过gzip压缩后大小为668KB,可以直接在网页浏览器中运行。该方法在PSNR方面比双三次插值有显著提升,但仅限于非生成式、2倍的放大任务。

  9. SIGNIFICANT · CL_160855 ·

    Microsoft 发布 VibeVoice-ASR-BitNet 以实现实时 CPU 推理

    Microsoft 发布了 VibeVoice-ASR-BitNet,这是一款高度压缩的自动语音识别模型,专为在边缘 CPU 上进行实时推理而设计,无需 GPU。该模型在实时因子 (RTF) 低于 1 的情况下,仅使用三个 CPU 线程,与 Whisper.cpp 等现有解决方案相比实现了显著的加速。通过异构量化实现压缩,将模型大小从 4.62 GB 减小到 1.58 GB,同时保持可比的准确性并支持多种语言。

  10. TOOL · CL_157942 ·

    新的 C99 推理引擎 Project Zero 为 BitNet 模型提供 1.8 倍加速

    一个名为 Project Zero 的全新、从头开始构建的 C99 推理引擎已被开发出来,它在 Xeon 处理器上运行 BitNet 模型时,比 bitnet.cpp 快 1.8 倍。该引擎拥有零外部依赖,仅在 CPU 上运行,无需 Python、CUDA 或 PyTorch。该项目还通过 GGUF 支持 Qwen Bonsai-27B 模型,并正在寻求社区在各种 CPU 架构上的基准测试,以进一步优化性能并扩大其排行榜的地位。

  11. TOOL · CL_149071 ·

    负比特量化通过反转张量嵌入释放VRAM

    一位研究人员开发了一种名为负比特量化(NBQ)的新技术,声称可以通过“负比特”配置实现稳定的推理,从而有效地释放VRAM。这种被称为相位反转张量嵌入(PITE)的方法,利用破坏性干涉模式将权重表示为亏损,这悖论式地增加了大型模型的可用内存。在Qwen 35B和Llama-3 70B模型上的初步测试表明,困惑度影响很小,同时显著提高了生成速度。

  12. SIGNIFICANT · CL_143192 ·

    PrismML 发布 Bonsai 27B,使 Qwen3.6-27B 可在笔记本电脑和手机上运行

    PrismML 发布了 Bonsai 27B,这是 Qwen3.6-27B 的高度压缩版本,有 1 位和三元变体。这些模型旨在在笔记本电脑和手机等消费级硬件上运行,其中 1 位版本仅需 3.9GB,三元版本需要 5.9GB。尽管经过了激进的压缩,三元模型仍保留了原始 FP16 模型约 94.6% 的性能,而 1 位版本则保留了 89.5%,使其适用于需要大上下文窗口和高效内存使用的应用程序。

  13. RESEARCH · CL_109464 ·

    新的 BITEMBED 框架大幅降低了大型语言模型嵌入成本

    研究人员开发了 BITEMBED,一个旨在为大型语言模型创建高效文本嵌入的新颖框架。该方法使用三元权重和量化激活将大型语言模型主干转换为低比特编码器,显著降低了计算成本和存储需求。BITEMBED 通过对比预训练和微调进行适应,并支持多种输出精度以平衡性能和存储需求。实验表明,BITEMBED 在提供显著效率提升的同时,实现了与全精度模型相当的性能。

  14. RESEARCH · CL_105121 ·

    新的量化方法提升大语言模型效率和速度

    研究人员开发了CAT-Q,一种新颖的训练后量化方法,可在无需大量重新训练的情况下显著压缩和加速大语言模型(LLMs)。该技术采用可学习调制和软化三值化,能够高效地量化从1.7B到235B参数的模型,仅使用少量校准样本,并取得了优于BitNet等现有方法的性能。此外,GRINQH提供了一种基于梯度输入的量化层级,通过根据激活值大小动态分配精度级别来优化大语言模型的生成,在Llama 3和Qwen3等模型上表现优于当前基线。

  15. TOOL · CL_105045 ·

    新型忆阻器突触设计有望实现高效的片上神经网络

    研究人员开发了一种用于片上神经网络的基于物理的设计,该设计利用了能够支持广泛电导状态的多级忆阻器突触。该设计根植于离子传输物理学,包括一个状态变量模型,该模型考虑了在各种噪声和漂移条件下可存储的子级别。所提出的架构将这些器件集成到1T1R交叉阵列结构中,从而在模拟域内实现模拟向量-矩阵乘法以及用于推理、反向传播和权重更新的原位学习规则。该设计旨在创建一个高密度、模拟、内存内神经网络处理器,在效率方面显著超越传统的CMOS和二元ReRA…

  16. COMMENTARY · CL_78658 ·

    三进制大语言模型在20亿参数处停滞,前沿实验室绕过该方法

    三进制大语言模型(使用三值系统表示权重)曾展现出早期潜力,但并未获得显著发展。目前可用的最大三进制模型仅为20亿参数,主要人工智能实验室也未采用此方法。尽管该架构具有潜在优势,但其停滞不前的原因尚不清楚。

  17. TOOL · CL_71783 ·

    Rust 引擎在边缘 CPU 上为 1 位 LLM 实现 150+ TPS

    一位开发者完全用 Rust 创建了一个新颖的 1 位量化大语言模型 (LLM) 推理引擎,绕过了 PyTorch 和 CUDA 等传统框架。该引擎实现了令人印象深刻的性能,在标准边缘 CPU 上展示了超过 150 token/秒 (TPS) 的吞吐量,内存占用不到 350MB。这项突破在于一种专有算法,该算法将极度压缩与智能保留相结合,使 1 位模型能够保持完整的流畅性和准确性。

  18. TOOL · CL_60288 ·

    AWS 训练阿塞拜疆模型,Tether 简化 LLM 微调

    AWS 正在其 SageMaker 平台上为阿塞拜疆语开发语言模型,旨在提高人工智能对代表性不足语言的可及性。Tether 发布了 Bitnet,一个简化大型语言模型微调的框架,使其更易于初创公司和小型团队适应。此外,开源模拟器 QEMU 正在探索在非关键领域使用人工智能进行代码贡献,而 Vidai 推出了基于 Rust 的人工智能网关,强调性能和安全性。

  19. RESEARCH · CL_17600 ·

    1位AI基础设施可在CPU上实现更快、无损的LLM推理

    研究人员开发了一个名为“this http URL”的软件栈,可在CPU上实现1位大型语言模型(LLM),如BitNet b1.58的快速、无损推理。这种新基础设施在x86 CPU上实现了2.37倍至6.17倍的速度提升,在ARM CPU上实现了1.37倍至5.07倍的速度提升,具体取决于模型大小。目标是使LLM更高效,并能在更广泛的设备上部署。