PulseAugur
实时 07:26:44
实体 Inspect AI

Inspect AI

PulseAugur coverage of Inspect AI — every cluster mentioning Inspect AI across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_191146 ·

    大型语言模型工具INSPECT-AI增强临床试验研究诚信评估

    研究人员开发了INSPECT-AI,这是一种新的人工智能辅助工具,旨在提高随机临床试验(RCT)研究诚信评估的透明度和效率。该工具与INSPECT-SR框架和研究诚信出处与证据本体(RIPE-O)结合使用,以记录评估过程。已创建了一个初步的知识图谱RIPE-KG,其中包含对95篇随机临床试验出版物的140项专家评估。

  2. TOOL · CL_182465 ·

    EvalPort 推出 11 种评分器类型,实现灵活的 LLM 评估

    EvalPort 开发了一个灵活的评分器系统,旨在适应各种 LLM 评估框架。该系统具有 11 种不同的评分器类型,每种类型都有特定的参数和评估方法,旨在广泛应用于实际场景。这种设计使得评估套件能够自描述,并允许不同的框架使用标准化的评分器 ID 来实现和比较结果。

  3. TOOL · CL_131520 ·

    新基准量化大语言模型沙箱逃逸能力

    研究人员开发了SANDBOXESCAPEBENCH,一个旨在安全评估大语言模型(LLMs)突破容器化沙箱环境能力的新基准。该基准以夺旗赛(CTF)挑战的形式实现,模拟了一个在容器内拥有shell访问权限的对抗性代理,并涵盖了各种逃逸机制,包括配置错误、权限错误和内核漏洞。初步研究结果表明,大语言模型能够成功识别并利用这些沙箱内的漏洞,突显了此类评估方法对于确保先进AI代理隔离环境的持续安全性的必要性。