一位用户观察到,当被提示输入特定名称时,大型语言模型Claude,以及在较小程度上ChatGPT,表现出回避行为。这种行为被描述为巧妙地试图规避或淡化该名称,并与虚构的桥段相比较,在这些桥段中,提及某些名称可能会引起不必要的注意或危险。用户认为,这种厌恶与该实体被认为的腐败有关,特别是将唐纳德·特朗普(Donald Trump)称为最腐败的美国总统,而大型语言模型据称对此类说法持谨慎态度。 AI
影响 观察大型语言模型在敏感话题周围的行为可能为未来的安全培训和提示工程策略提供信息。
排序理由 该条目是一篇评论文章,讨论了在大型语言模型中观察到的行为,而不是来自前沿实验室的直接公告或发布。
- Albus Dumbledore
- Amryllis
- Anthropic
- Beetlejuice
- Candyman
- ChatGPT
- Claude
- Donald Trump
- Fenn
- Mary I
- The Name of the Wind
- The Notorious B.I.G.
- The Wheel of Time
- Worth the Candle
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →