Flash Attention 2
PulseAugur coverage of Flash Attention 2 — every cluster mentioning Flash Attention 2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
CohereLabs发布24亿参数视觉语言模型
CohereLabs发布了North-Micro-Vision-Instruct,一个基于Apache 2.0许可的24亿参数视觉语言模型。该模型采用SigLIP 2编码器,支持128K文本上下文窗口和8K多模态上下文,并集成了Flash Attention 2。值得注意的是,它不支持工具调用或系统提示。
-
Stable Diffusion 用户分享 Windows 下 Sage 和 Flash Attention 2 的可用配置
一位 Reddit 用户成功地将 Sage 和 Flash Attention 2 集成到其 Windows 11 Stable Diffusion 的 ComfyUI 安装中。他分享了一个可用的配置,包括具体的软件版本和硬件细节,旨在帮助其他面临类似挑战的用户。该用户指出,Sage attention 似乎提供了速度上的提升。
-
Sage Attention 优化已发布,用于 ideogram,声称速度提升 25%
Sage Attention 是一种新的优化技术,已发布并针对 ideogram 进行了特定的头配置。此次更新声称在 5090 GPU 上比 Flash Attention 2 提供了 25% 的速度提升。发布内容包含 Windows 所需文件的下载链接。
-
Ideogram 4 通过本地设置和 bbox 提示实现高质量
一位 Reddit 用户分享了他们本地使用 Ideogram 4 的体验,强调了其令人印象深刻的指令遵循能力和知识库。他们详细介绍了使用 RTX 3060 GPU、64GB RAM 的设置,以及 int8 量化和 Flash Attention 2 等特定优化以显著提速。该用户还强调了使用 JSON 和边界框进行提示的强大功能,这可以实现更精确的控制并绕过模型的安全过滤器。
-
Flash Attention 2 实现显著提升 V100 GPU 性能
一位 Reddit 用户分享了他们在 V100 GPU 上实现 Flash Attention 2 的经验,并指出内存利用率和速度有了显著提高。该自定义实现来自 GitHub,与标准的 PyTorch 实现相比,在正向和反向传播中,内存使用量减少了高达 93.9%,速度提升了 3 倍到 24 倍以上。用户观察到模型回答前的思考时间大大缩短,这表明除了基准测试数据外,还带来了实际的性能优势。
-
OpenMythos 项目重建 Anthropic 秘密的 Claude Mythos AI 模型
一个名为 OpenMythos 的新开源项目已发布,旨在理论上重建 Anthropic 的 Claude Mythos 模型的架构。该项目实现了一个循环深度 Transformer (RDT),其独特结构包括前奏、循环递归块和尾声。RDT 设计通过在单次前向传播中多次重复利用部分层来实现深度可变推理,这与思维链处理不同。