Nemotron 3 Super 120B
PulseAugur coverage of Nemotron 3 Super 120B — every cluster mentioning Nemotron 3 Super 120B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
研究发现:大型语言模型会捏造沙特法律引文,但不会捏造GDPR · 跟踪2个来源
一项新的基准研究揭示,大型语言模型(LLMs)在准确引用法律文件方面存在显著差异,尤其是在处理不同司法管辖区时。虽然Gemini 2.5 Flash、GPT-OSS-120B和Nemotron-3-Super-120B等模型在欧盟的《通用数据保护条例》(GDPR)方面表现良好,但它们经常捏造沙特《个人数据保护法》(PDPL)的引文。这种捏造无论查询语言(阿拉伯语或英语)如何都会发生,并且通常以高度自信的方式呈现,这凸显了在依赖LLMs…
-
LLM社区呼吁紧急发布80-160B参数模型
r/LocalLLaMA子版块的用户正在表达对80-1600亿参数范围内新的大型语言模型(LLM)的强烈需求。现有模型要么对于拥有高容量但速度较慢的统一内存系统(如Apple设备或AMD Ryzen AI 395)的用户来说太小,要么对于VRAM有限的用户来说太大。社区要求能够有效利用80-128GB RAM或64GB VRAM的系统运行的模型,因为现有选项要么过时,要么不适合他们的硬件配置。
-
爱沙尼亚基准测试:Claude Opus 4.7 最能抵御俄罗斯宣传
爱沙尼亚语言研究所发布了一项名为“宣传抵抗”的新基准测试,以评估大型语言模型在抵御俄罗斯国家支持的虚假信息方面的能力。该基准测试涵盖了三种语言中的14种俄罗斯宣传叙事,模型回答了75个问题。Anthropic的Claude Opus 4.7表现最佳,得分接近满分,而NVIDIA的Nemotron 3 Super 120B和阿里巴巴的Qwen 3.6 Plus也表现出强大的抵抗力。
-
西方开源模型在SOTA竞赛中落后于中国AI
Reddit的r/LocalLLaMA板块的讨论表明,目前的开源模型SOTA(State-of-the-Art,技术最先进)之争在Google的Gemma 4 31B和Mistral AI的Nemotron 3 Super 120B之间。讨论中表达了对西方模型未能在此特定基准上领先的失望,并提到了Meta过去的贡献。对话还强调了中国AI模型正在形成的激烈竞争格局。