int8 quantization
PulseAugur coverage of int8 quantization — every cluster mentioning int8 quantization across labs, papers, and developer communities, ranked by signal.
-
Ollama v0.32.6 提升 Qwen 3.5 在 Apple Silicon 上的速度,改进 OpenAI 兼容性 · 跟踪 4 个来源
Ollama 发布了 0.32.6 版本,通过 MLX 引擎和推测性解码显著提高了 Qwen 3.5 模型在 Apple Silicon Mac 上的性能。此次更新还通过对 /v1/chat/completions 端点的流式格式进行对齐,增强了与 OpenAI API 的兼容性。此外,KataGo 和 llama.cpp 等其他相关项目也收到了错误修复,KataGo 解决了 TensorRT 问题,llama.cpp 解决了 Vul…
-
联邦自动编码器在边缘设备上增强了具有隐私保护的心电图异常检测
研究人员开发了一种用于在边缘设备上检测心电图(ECG)数据异常的隐私保护联邦自动编码器系统。该系统结合了联邦学习、差分隐私和INT8量化,以维护患者的机密性,实现在Raspberry Pi 4等受限硬件上的实时推理,并在来自不同医院的非独立同分布(non-IID)数据下也能实现高质量的检测。研究发现,联邦学习的性能与集中式基线相当或更优,而INT8量化在准确性损失极小的情况下显著减小了模型大小和延迟,证明了隐私保护和边缘部署可以同时实现。
-
Ideogram 4 通过本地设置和 bbox 提示实现高质量
一位 Reddit 用户分享了他们本地使用 Ideogram 4 的体验,强调了其令人印象深刻的指令遵循能力和知识库。他们详细介绍了使用 RTX 3060 GPU、64GB RAM 的设置,以及 int8 量化和 Flash Attention 2 等特定优化以显著提速。该用户还强调了使用 JSON 和边界框进行提示的强大功能,这可以实现更精确的控制并绕过模型的安全过滤器。