Hermes IDE
PulseAugur coverage of Hermes IDE — every cluster mentioning Hermes IDE across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
LLM 成本归因:使用 OpenTelemetry 为代理追踪打标签
一位开发者概述了一种方法,通过利用 OpenTelemetry 追踪来归因与生成式人工智能代理相关的成本。该方法涉及在代理执行追踪中的 span 上添加特定属性,如代理名称、版本、功能、步骤和使用的模型。这种详细的标记实现了细粒度的成本分析,超越了人工智能服务提供商通常提供的汇总账单。通过实施这些约定,开发者可以识别哪些特定的代理操作对成本贡献最大,将账单从一个谜团转变为一个可查询的数据集。
-
使用集中的 Span Processor 对 LLM 痕迹中的 PII 进行脱敏
一种对 LLM 应用痕迹中的个人身份信息 (PII) 进行脱敏的新方法,侧重于使用集中的 Span Processor,而不是修改单个调用点。此方法可确保在数据离开应用程序之前进行一致的 PII 清洗,从而解决详细的 LLM 仪器化固有的安全风险。所提出的解决方案涉及 OpenTelemetry 中的自定义 SpanProcessor,该处理器可识别并替换特定 span 属性和事件中的电子邮件、信用卡号和电话号码等敏感数据。
-
LLM Prompting: Position Beats Rank for Long Contexts
长上下文提示中的一个常见问题是语言模型难以准确地从提供的文本中间检索信息。诸如“Lost in the Middle”论文等研究表明,当相关信息放置在上下文窗口的开头或结尾时,模型的表现最佳,而中间信息的准确性会显著下降。为了解决这个问题,采用了一种称为“重排序”的技术,即将排名最高的相关文本块策略性地放置在上下文的开头和结尾,而排名较低的文本块则放在注意力较弱的中间部分。这种位置优化,而不是严格的相关性排序,有助于提高模型利用长上下…
-
LLM运维:检测评估漂移并跟踪客户成本
作者讨论了管理LLM应用的两个常见挑战:评估集漂移和按客户成本报告。对于评估集漂移,他们建议在嵌入上使用最大均值差异(MMD)来检测评估数据集何时不再代表生产数据。对于成本报告,他们建议利用OpenTelemetry baggage在服务之间传播客户ID,避免昂贵的管道重新架构。