Colibri
PulseAugur coverage of Colibri — every cluster mentioning Colibri across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
Colibri's streaming technique shows promise for efficient local LLM deployment
The Colibri project's proof-of-concept, which allows a 744B parameter GLM-5.2 model to run on 25GB RAM by streaming components, indicates a significant advancement in making large AI models accessible on consumer hardware. This approach, even with current slow speeds, highlights a viable path for local AI setups and could influence future LLM architecture design for efficiency.
Colibri project releases optimized C engine for broader LLM accessibility
The Colibri project has demonstrated a novel streaming technique to run massive LLMs like GLM-5.2 on consumer hardware with limited RAM. The recent adaptation for the Hy3 model and its pure C implementation suggest a potential release of an optimized engine that could significantly lower the barrier to entry for running large models locally, possibly within the next 3 months.
Colibri's efficiency gains could be benchmarked against other local LLM solutions
Given Colibri's success in running large models on limited hardware, it's probable that benchmarks comparing its performance (tokens/sec, RAM usage) against other emerging local LLM solutions will become available soon. This would help quantify its practical usability and identify its strengths and weaknesses for different applications.
-
Lumabri 支持 P2P MoE 模型执行;Google Meet 新增线下会议转录功能
Lumabri 是一个新开源项目,允许用户使用 Colibri 协议在点对点网络上运行专家混合(MoE)模型。该项目由 JustVugg 开发,旨在实现 AI 模型执行的去中心化。另外,Google Meet 推出了允许转录线下会议的功能,将口头对话转化为书面笔记。
-
开发者在双 Tenstorrent 卡上运行了 744B GLM-5.2 模型
Tenstorrent 的一位开发者成功地在双卡设置上运行了拥有 7440 亿参数的 GLM-5.2 模型,实现了每秒 0.35 个 token 的性能。这是通过借鉴 Colibri 项目的方法实现的,该项目通过按需流式传输专家子网络来优化内存使用。开发者在关注性能之前,仔细地将模型实现的每个组件与参考版本进行了核对,以确保高准确性。
-
Lumabri 旨在去中心化大语言模型访问,灵感来自 Napster
Lumabri 是一个旨在实现大语言模型(LLMs)在标准计算机上使用的项目,其灵感来源于 Napster 的去中心化文件共享模式。该项目最初名为 Colibrì,部分得益于 HackerNews 社区的贡献,已显著扩展。它在 Mastodon 上被呈现为“Show HN”,强调了其开源性质和使大语言模型技术更广泛可及的潜力。
-
Colibri 引擎可在 25GB RAM 机器上运行大型 LLM
Colibri 是一款新推出的开源 AI 引擎,旨在让用户在仅需 25GB RAM 的消费级硬件上运行大型语言模型,例如 GLM-5.2(一个 744B 参数的混合专家模型)。Colibri 完全用 C 语言编写,没有任何依赖项,通过从磁盘流式传输模型专家来实现这一目标。这项创新使得计算资源有限的用户也能更方便地使用强大的 LLM。
-
Colibri 项目通过磁盘流式传输实现在消费级硬件上运行 744B 参数模型
Colibri 项目开发了一种新颖的磁盘流式传输技术,可以在内存有限的消费级硬件上运行大型语言模型,例如 Z.ai 的 GLM-5.2(拥有 7440 亿参数)。该方法将保留在内存中的密集模型主干与按需从高速 NVMe SSD 流式传输的稀疏专家层分开。虽然初始性能较慢,但随着常用专家被缓存到内存中,吞吐量会显著提高,使其适用于批处理和长时任务。
-
新的AI运行时操作系统在通用硬件上编排模型
一位开发者创建了UGR,一个开源的AI运行时操作系统,旨在管理通用硬件上的AI推理工作负载。UGR作为现有推理引擎(如llama.cpp和TensorRT-LLM)之上的一个编排层,将AI模型视为可以动态地在不同内存层级(VRAM、RAM、NVMe)之间移动的资源集合。这种方法旨在克服CUDA内存不足等限制,特别是对于拥有较旧或性能较低GPU的用户。该项目还包括一个模拟引擎,用于在执行前预测性能和资源使用情况。
-
研究揭示语义背景显著影响跨领域颜色命名
一篇新论文探讨了颜色名称的语义背景如何影响其在不同领域的解释。研究人员分析了来自化妆品、Crayola 和汽车颜色的颜色命名数据集,并将它们映射到 COLIBRI 颜色模型上。研究发现,每个领域对颜色空间的利用方式不同,Crayola 覆盖范围最广,化妆品侧重于暖色调,而汽车颜色则专注于蓝色和非彩色。这些发现强调了语义背景在人类颜色感知中的重要性,并为设计分析、产品搜索和以人为中心的人工智能提供了应用前景。
-
现在可以在消费级笔记本电脑和 PC 上运行巨大的 AI 模型
新的发展使得在消费级硬件上运行大型 AI 模型成为可能,显著降低了本地 AI 开发的门槛。AirLLM 等项目能够让参数量为 700 亿的模型在仅需 4GB VRAM 的 GPU 上运行,而 Colibri 则允许参数量为 7440 亿的模型通过从磁盘流式传输专家来在拥有 25GB RAM 的笔记本电脑上运行。这些进展,以及 wigolo 用于本地网络研究和 code-review-graph 用于上下文管理的工具,使开发人员能够拥有…
-
GLM-5.2 模型可在配备 25GB RAM 的消费级硬件上运行 · 已追踪 2 个来源
据报道,拥有 744B 参数的混合专家(MoE)模型 GLM-5.2 可以在消费级硬件上运行。一位用户分享说,它可以在大约 25 GB RAM 的机器上运行,而另一位用户详细介绍了其在配备 48 GB RAM 的 MacBook Pro M5 上的性能,速度在每秒 2 到 2.8 个 token 之间。这一进展表明在本地运行大型语言模型的可用性有所提高。
-
Colibri 流式传输技术适配 Hy3 模型,降低显存需求
一种新的 Colibri 流式传输技术移植已开发完成,可使 Hy3 大型语言模型在仅需 10GB 显存的硬件上运行。与原始 Colibri 实现相比,这大大降低了内存需求,后者需要 25GB 显存来运行 GLM 5.2 模型。该项目可在 GitHub 上找到,并建议在显存不足时使用系统内存。
-
Colibri 语言模型在 25GB RAM 的笔记本电脑上运行 744B 参数
一款名为 Colibri 的新语言模型,基于 GLM-5.2,已被开发出来,仅需 25GB RAM 即可在笔记本电脑上运行。该模型拥有 7440 亿参数,采用混合专家(MoE)架构,通过每次仅激活约 400 亿参数来实现效率。该实现使用纯 C 语言编写,没有任何外部依赖,使其高度易于访问。
-
Colibrì 概念验证模型在 25GB RAM 上运行巨大的 1.5TB AI 模型
一位名叫 Vincenzo(也称为 JustVugg)的意大利工程师开发了一个名为 Colibrì 的概念验证模型,该模型能够在一个仅有 25GB RAM 的普通 CPU 上运行一个 1.5TB、7440亿参数的 GLM-5.2 AI 模型。尽管目前的性能极其缓慢,每秒仅为 0.05-0.1 个 token,使其不适用于实时使用,但将模型组件分块加载到 RAM 的方法预示着本地 AI 设置的潜力。这种方法有可能使与 Anthropic…
-
GLM-5.2 模型通过 colibri 引擎更新以实现更快的推理速度
Hugging Face 上发布了 GLM-5.2 模型的新版本,名为“colibri int4 with int8 mtp”。此版本基于原始 GLM-5.2 模型,并采用了 int8 MTP 头部,旨在通过推测性解码显著提高推理速度。该模型需要 colibri 引擎才能运行,并且与 GGUF 或 AWQ 等标准格式不兼容。它在 MIT 许可下分发。
-
人工智能数据中心热潮面临美国社区日益增长的反对 · 追踪到4个来源
美国各地社区对人工智能数据中心建设的反对情绪正在迅速增加,自2025年以来,当地团体数量增加了两倍多。这种日益增长的反对浪潮,源于对能源消耗、用水量和环境影响的担忧,正开始延迟或叫停重大项目。弗吉尼亚州近期的失败案例凸显了社区接受度成为选址的一个关键新因素,挑战了该行业的快速扩张计划。
-
开发者在消费级硬件上运行了巨大的 744B GLM-5.2 模型
一位开发者创建了一个名为 Colibri 的 C 语言引擎,该引擎允许拥有 7440 亿参数的大型 GLM-5.2 模型在内存约 25 GB 的消费级硬件上运行。这是通过按需从磁盘流式传输模型专家来实现的,而不是要求所有专家都加载到内存中。该引擎是一个单一的 C 文件,旨在让功能强大的 AI 模型在性能较低的机器上也能使用。
-
GLM-5.2 模型通过 Colibri 引擎实现量化,可在消费级硬件上运行
GLM-5.2 模型的一个量化版本,名为 jlnsrk/GLM-5.2-colibri-int4,已在 Hugging Face 上发布。该版本通过从磁盘流式传输专家,旨在在消费级硬件上运行,需要大约 25 GB 的 RAM 和 400 GB 的快速本地存储。该模型使用自定义容器格式,仅与 Colibri 引擎兼容,不支持 GGUF 或 GPTQ 等标准格式。