实体
AIriskEval-edu
AIriskEval-edu
PulseAugur coverage of AIriskEval-edu — every cluster mentioning AIriskEval-edu across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新AI平台审计教育性解释中的教学风险
研究人员开发了AIriskEval-edu Demo,一个旨在审计教育性解释教学质量的平台。该系统在五个维度上评估解释:事实准确性、深度、相关性、学生适宜性和意识形态偏见,提供二元决策、置信度分数和自然语言理由。它利用API的GPT-5.5和在自定义数据集上微调的自托管Llama 3.1 8B模型。本地评估器在大多数指标上表现优于GPT-5.5,为教育机构提供了一个安全的、内部的内容审计解决方案。
-
新数据集训练LLM进行K-12教育风险评估 · 跟踪3个来源
研究人员开发了AIriskEval-edu-db2,这是一个旨在训练和评估大型语言模型(LLMs)用于评估K-12教育内容中教学风险的新数据集。该数据集包含来自ScienceQA问题的1600多个解释,其中包含人类编写的示例以及旨在展示特定风险的LLM生成的示例。它还包含了可解释性的结构化注释,在事实准确性、完整性、相关性、恰当性和意识形态偏见等维度上定位和描述风险。验证实验将专有模型与本地Llama 3.1 8B模型进行了比较,探索…