PulseAugur
实时 16:34:21
实体 BEA 2025 Shared Task

BEA 2025 Shared Task

PulseAugur coverage of BEA 2025 Shared Task — every cluster mentioning BEA 2025 Shared Task across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_141179 ·

    新AI模型FATE评估导师质量,对标顶级LLM

    研究人员开发了FATE,一个拥有80亿参数的语言模型,用于评估人工智能导师的教学质量。该模型与BEA 2025共享任务的评估轨道一致,评估错误识别、定位、指导和可操作性。通过从前沿LLM进行知识蒸馏,FATE的性能提升高达22.63个百分点。在与商业模型的基准测试中,Gemini 2.5 Flash得分最高,达到82.88%,其次是ChatGPT 5.5 Instant、DeepSeek-V4 Flash和Claude Sonnet 4.6。