Heretic
PulseAugur coverage of Heretic — every cluster mentioning Heretic across labs, papers, and developer communities, ranked by signal.
- 2026-05-25 product_launch Heretic tool gains attention for its ability to remove guardrails from AI models. 来源
4 天有情绪数据
-
Heretic工具旨在移除开源权重LLM的审查
Heretic是一款旨在移除开源权重大型语言模型审查的新工具。该工具由Paul Watkins开发,旨在让用户更好地控制这些AI模型的输出。
-
Heretic创建者警告不要将未审查模型用于文本编码
Heretic的创建者(Heretic是一个用于“解除审查”大型语言模型的工具)已发出警告,反对将“heretic”模型用作其他AI系统(如H3等图像和视频生成模型)的文本编码器。创建者解释说,Heretic通过修改有害输入的内部表示来混淆LLM使其合规,但这个过程并不会创建更准确或“原始”的表示。因此,将这些修改后的模型用作扩散模型的文本编码器并不会消除输出中的审查,甚至可能降低性能或引入伪影。
-
无审查AI模型:三种风险,而非一种解决方案
“无审查GPT”的概念并非单一功能,而是三种截然不同的风险,每种风险都有不同的后果。第一种是使用标准ChatGPT的越狱提示,主要风险是账户被封禁。第二种是使用第三方包装器或机器人,通常在Telegram上发现,它们通过窃取的API密钥出售访问权限,存在财务损失和数据泄露的风险,AI伴侣应用的安全性审计证明了这一点。第三种方法是使用本地运行的无审查模型,如Dolphin,风险转移到用户对模型输出的责任,因为“魔鬼已经放出瓶子”,工具会…
-
发布新的无审查大语言模型:LongCat、Jamba2、Qwen3.5 变体
已发布多个无审查版本的大语言模型,包括 LongCat-Flash-Lite、Jamba2-Mini 和 Qwen3.5 变体。LongCat-Flash-Lite 模型是一个 69B-A3B 参数模型,已修改以将拒绝率从 100/100 降低到 9/100,加载 GGUF 格式需要特定的 llama.cpp 分支。Jamba2-Mini 是一个 52B 参数的混合 Mamba 模型,其拒绝率从 97/100 降低到 4/100,并兼…
-
Heretic Qwen3 VL 模型在 Stable Diffusion 中出现零 token 输出问题
Reddit r/StableDiffusion 版块的一位用户报告了 Qwen3 VL 4B 模型“Heretic”版本的一个奇怪问题。当 `thinking` 参数设置为 `false` 时,该模型有时会无法生成任何文本输出,导致响应为空。与官方 Qwen3 VL 模型相比,后者不会出现这种零 token 问题,但可能会拒绝处理敏感或露骨的图像。该用户希望了解这种零 token 行为是否可复现,以及是否可能与 ComfyUI 的近…
-
Kimi K3.0 模型变体采用专有“消融”方法将于 2026 年 7 月推出
名为 audnai/penclaw-Kimi-K3.0-abliterated-GGUF 的 Kimi K3.0 模型新变体将于 2026 年 7 月 27 日发布。该模型将采用专有的“消融”(abliteration)方法,旨在减少在红队测试中对灰色区域提示的拒绝,同时保持对有害提示的强力拒绝。该方法将在即将发布的论文中详细介绍,并使用 Heretic 评估机制来量化其有效性,目标是避免诸如在良性提示上过度拒绝或在代码生成中出现损坏…
-
Qwen3-VL-4B-Instruct 模型为 ComfyUI 修改,旨在无审查使用
Qwen3-VL-4B-Instruct 模型的一个修改版本 Heretic 已发布,可用于 ComfyUI。此版本经过了“abliteration”过程以移除拒绝机制,旨在提高对安全基准的合规性,同时保留模型在 GSM8K 和 MMLU 等任务上的核心智能和性能。发布版本包括针对不同 GPU 功能优化的各种量化格式,并提供了集成到 Krea 2 工作流的详细说明。
-
瑞士最高法院评估 Heretic 工具以修复 LLM 过度对齐问题
瑞士联邦最高法院正在探索使用 'Heretic' 工具来缓解大型语言模型 (LLM) 的过度对齐问题。此项调查源于法院自身在使用 LLM 时遇到的合法请求被拒绝的挑战,这也是 r/LocalLLaMA 社区用户面临的普遍问题。一篇题为《衡量与缓解多语言刑事法院 LLM 的过度对齐》的研究论文对 Heretic 给予了积极评价,认为其有潜力解决这些对齐问题,尤其是在法律领域。
-
Gemma 4 12B Heretic模型生成单个HTML文件中的完整游戏
一位Reddit用户分享了使用Gemma 4 12B的“heretic”版本进行编码任务的经验。这个修改后的模型成功地在一个HTML文件中生成了一个完整、可玩的“Retro Cyberpunk Brick Breaker”游戏。该过程使用了超过45,000个token的巨大上下文窗口,用户报告称生成速度稳定在每秒约18个token。
-
新的 Apostate 工具可“清除”LLM 安全训练,可与 Heretic 相媲美
一款名为 Apostate 的新工具已被开发出来,用于“清除”大型语言模型中的安全训练。基准测试将其与 Heretic 和 Huihui 等现有工具进行了比较。虽然 Heretic 的表现略好,在参数改动极小的情况下实现了 100% 的拒绝移除成功率,但 Apostate 和 Huihui 也取得了 98% 的强劲表现。分析显示,这些工具在 Qwen 2.5 7B 模型中找到了不同的“拒绝方向”,表明安全训练并非只有一个失败点。
-
JetBrains 发布 Mellum2,Heretic 工具助力审查移除,NVIDIA 推出 Cosmos 3
JetBrains 发布了 Mellum2,一个拥有 120 亿参数的专家混合(MoE)模型,针对高效的本地 AI 推理进行了优化。与此同时,GitHub 上出现了一个名为 'Heretic' 的新工具,旨在自动移除开源语言模型的审查,使用户能够更好地控制模型的输出。NVIDIA 也推出了 Cosmos 3,一个专注于物理 AI 推理和行动的开源全能模型,旨在增强消费级硬件的多模态能力。
-
Heretic 工具通过 Abliteration 绕过 AI 安全机制
IT 安全研究人员已证明,使用名为“Heretic”的工具可以完全绕过公开可用 AI 模型的安全机制。这种称为“Abliteration”的技术专门针对并停用了负责拒绝有害请求的 AI 模型部分。这些发现突显了当前 AI 安全协议中的一个重大漏洞。
-
免费工具绕过 Meta 和 Google AI 模型的安全防护
一个名为 Heretic 的免费 GitHub 工具已证明能在几分钟内绕过 Meta 的 Llama 3.3 和 Google 的 Gemma 模型的安全防护。该工具适用于开源 AI 模型,据报道已被用于创建数千个可生成有害内容的修改版本,例如关于生物武器的说明。研究人员指出,这凸显了 AI 安全方面的一个重大挑战,因为这些模型的开源性质允许移除内置的限制。
-
Heretic 工具移除 Llama 3.3 安全护栏,下载量达 1300 万次
据报道,由 Philipp Emanuel Weidmann 创建的名为 Heretic 的工具可以在 10 分钟内移除 Meta 的 Llama 3.3 模型中的安全护栏。自发布以来,Heretic 已被用于创建超过 3500 个“已解除审查”的模型,下载量达 1300 万次。Weidmann 自称为数学家和工程师,旨在确保无限制模型保持可用。
-
Heretic 工具通过命令行自动去除语言模型审查
Heretic 是一个命令行工具,旨在“去除审查”语言模型,使其对每个人都可用。它利用定向消融和基于 Optuna 的 TPE 优化来最大限度地减少拒绝响应,同时通过限制 KL 散度来保持原始模型的性能。该工具支持多种密集型、MoE 和多模态模型,并包含 bitsandbytes 量化和 PaCMAP 残差可视化等研究功能。
-
Gemma 4 QAT模型引发关于性能和实用性的讨论
用户正在讨论Gemma 4 QAT(量化感知训练)模型的性能和实用性,特别是将其与标准量化进行比较。虽然一些用户报告称通用任务的速度和质量有所提高,但其他用户认为QAT模型是一种倒退,尤其是在工具调用或编码等特定用例方面。正在进行基准测试以量化差异,结果喜忧参半,表明QAT模型并不总是优于更高比特的标准量化,有时还会表现出意外行为。