Mistral AI发布了Shieldstral,一个拥有30亿参数的Guard模型,用于分类内容策略违规。与LlamaGuard和ShieldGemma等先前模型不同,Shieldstral的策略嵌入在提示中而非模型权重中,允许在不重新训练的情况下进行动态调整。这种方法使Shieldstral能够作为二元分类器运行,根据“是”或“否”标记的logits输出0到1之间的分数,与固定标签相比,在设置审核阈值方面提供了更大的灵活性。 AI
影响 通过允许在不重新训练的情况下动态调整策略,为内容审核提供了一种更灵活且具成本效益的方法。
排序理由 前沿实验室(Mistral AI)发布新模型。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →