EmbeddingGemma
PulseAugur coverage of EmbeddingGemma — every cluster mentioning EmbeddingGemma across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
87GB LLM 通过量化在 CPU 上运行;vecq 工具针对设备端嵌入
最近的一项基准测试表明,Qwen3.8-Flash-Next 大型语言模型(文件大小为 87.2 GiB)可以使用 llama.cpp 框架在 CPU 上以 8.34 tokens per second 的速度运行。这种性能是通过 4 位量化实现的,它显著减小了模型的大小。基准测试还显示,在 245K 的上下文长度下,96GB VRAM 相对于 24GB 的性能优势会减弱,并且将模型的嵌入表放在 GPU 上会极大地提高解码速度。为了解…
-
AI记忆基准在初步指标被发现误导后进行修订
Bastra Recall(一个用于Claude的MIT许可的内存服务器)的开发者在意识到其98.3%的初步召回率是一个同义反复后,修订了他们的基准测试方法。这个新基准测试使用六个不同的角色代理来为30个记忆生成释义查询,模拟用户随着时间推移描述不同情况的真实使用场景。修订后的测试显示,虽然仅词汇搜索在释义查询上的召回率为63.1%,但本地嵌入将性能显著提高到79.6%,特别是对于语言或经验水平存在差异的查询。开发者还发现,触发短语和…
-
开发者使用 RAG 构建完全本地化的印度尼西亚语语音代理
一位开发者创建了一个完全离线的语音代理应用程序,该应用程序利用本地AI模型进行印度尼西亚语处理。该系统使用Whisper进行语音转文本,使用Ollama托管Gemma 3 1B等模型,并使用本地文本转语音模型进行语音响应。这种设置允许在不依赖云服务的情况下进行隐私保护的交互,使其适用于互联网连接有限的地区。