MarkTechPost
PulseAugur coverage of MarkTechPost — every cluster mentioning MarkTechPost across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Google 和 Microsoft 的 WebMCP 协议旨在革新 AI 代理的网页导航
Google 和 Microsoft 开发的新协议 WebMCP 正在集成到 Chrome 146 中,以简化 AI 代理与网站的交互方式。该协议将代理的交互逻辑移至浏览器,允许网站通过 JavaScript API 注册工具。这使得代理可以直接调用这些工具,显著减少了当前方法(如 DOM 抓取和截图)所带来的时间和代币成本以及脆弱性。尽管早期基准测试显示效率和准确性有显著提高,但在草案规范中,关于权限粒度和跨源数据泄露的重大安全问题仍未解决。
-
NVIDIA 发布 cuDNN Graph API,用于优化 AI 计算图
NVIDIA 推出了 cuDNN Graph API,这是其 cuDNN Frontend 中的一项新功能,允许开发者将计算定义为操作图。该 API 使 cuDNN 能够自动选择和优化这些图的执行引擎,并结合融合、自动调优和计划重用等技术。本教程通过构建和执行融合卷积、探索不同配置下的自动调优,以及集成 FP8 支持和 CUDA 图捕获等功能,演示了如何使用此 API,并与 PyTorch 的结果进行了验证。
-
Gradium推出文本提示词AI语音生成器
语音AI公司Gradium推出了Voice Design,这是一款根据文本描述生成合成语音的新工具。与传统的语音克隆不同,Voice Design不需要参考音频或说话者同意,允许用户在几秒钟内创建独特的语音。该工具支持多种语言,每次提示最多可提供五个语音候选。在盲听测试中,据报道Gradium的系统表现优于ElevenLabs等竞争对手,胜率为72.6%。
-
Anthropic推出Claude Fable 5.1,编码能力提升,成本降低 · 追踪10个来源
Anthropic发布了其最新的AI模型Claude Fable 5.1和Mythos 5.1,在编码和科学研究方面提供了改进的性能。Fable 5.1是通用版本,在Terminal-Bench-Science等基准测试中取得了显著的进步,并以其增强的编码能力而闻名。这两个模型都拥有100万个token的上下文窗口,并大幅降低了缓存数据的成本,使得复杂、代理任务的成本最高可降低45%。Mythos 5.1仅限于经过审查的组织用于特定的…
-
FreeToken使大型AI模型能在消费级GPU上运行 · 已追踪4个来源
FreeToken是加州大学伯克利分校开发的一款开源引擎,它允许像拥有7530亿参数的GLM-5.2这样的大型专家混合(MoE)模型在消费级硬件上运行。它通过将个人计算机视为一个统一的弹性推理平台,动态地将计算映射到GPU、CPU和内存上,从而实现这一点。这项创新为在边缘部署前沿规模的AI模型开辟了新的可能性。
-
docTR 库支持端到端文档智能管道
本教程演示了如何使用 docTR 库构建端到端文档智能管道。它涵盖了光学字符识别 (OCR)、布局分析和知识信息提取 (KIE) 等关键步骤。该过程包括生成合成发票文档、配置 OCR 预测器以提高速度和准确性,以及实现双通道识别和自定义管道钩子等高级功能。教程还详细介绍了如何处理旋转文档、重建阅读顺序、提取结构化数据以及将结果导出为包括可搜索 PDF 在内的各种格式。
-
DeepSeek Harness 开启可定制、自进化代理的大门 · 已追踪 10 个来源
DeepSeek 发布了其开源的 DeepSeek Harness (DSH) 代理框架,该框架构建在 Cordis 插件系统之上,实现了“一切皆插件”的极致定制化。这种架构允许开发者替换或扩展任何组件,从模型、工具到代理循环本身,从而促进自进化代理的发展。该框架在 GitHub 上获得了显著关注,用户为其创建了大量插件,用于实际任务、迷你游戏和数字宠物等创意应用,甚至用于管理礼貌性。虽然这种灵活性受到赞扬,但潜在的担忧包括大量使用插…
-
Google 发布 Meridian 用于贝叶斯营销组合建模
Google 发布了 Google Meridian,一个使用 TensorFlow 和 TensorFlow Probability 构建的新的贝叶斯营销组合建模框架。本教程演示了如何使用 Meridian 进行端到端的媒体衡量、投资回报分析和预算优化。该框架允许用户定义可解释的先验、使用 NUTS 采样拟合模型,并分析渠道贡献、有效性和饱和度。Meridian 还包括用于优化营销预算和生成可共享报告的工具。
-
TimesFM 2.5 凭借新功能增强时间序列预测能力
时间序列预测模型 TimesFM 2.5 已更新,加入了用于端到端工作流开发的先进功能。新版本支持回测、协变量集成、异常检测和可扩展部署。用户现在可以使用各种指标评估预测质量,并在不同场景下测试模型的鲁棒性,包括长周期预测和输入变化。
-
新的 GAUGE 基准评估 AI 金融模型与分析师实践的对比
一个名为 GAUGE 的新基准已被开发出来,用于评估 AI 生成的金融模型,它摒弃了单一答案评分,转而根据观察到的分析师实践进行更现实的评估。该基准利用了大量的分析师工作簿数据集和详细的评估集,以评估模型在各个方面的性能。初步测试表明,虽然 AI 代理能够有效地构建模型,但它们的估值判断仍落后于人类资深分析师。
-
Patter SDK 指南:构建餐厅预订电话代理
Patter SDK 在一份构建餐厅预订电话代理的指南中进行了详细介绍。本教程演示了如何通过定义动态变量、集成可调用工具和实现输出护栏来创建处理真实对话的 AI 电话助手。它涵盖了模拟语音转文本和文本转语音、运行脚本通话流程以及检查 Patter API。该指南还解释了如何在结构化的语音代理管道中创建确定性代理大脑、监控延迟和成本指标以及通过评估验证系统。
-
使用 lift-pdf 构建的模式引导发票智能管道
本教程详细介绍了使用 lift-pdf 创建一个端到端的应付账款提取管道。该过程包括生成合成发票,定义关键字段(如供应商身份和总金额),然后指示模型直接从 PDF 布局中提取这些值。它解决了实际挑战,例如区分账单地址和送货地址以及处理部分付款的发票,旨在为发票挖掘提供文档智能的真实演示。
-
顶级无代码AI工具加速工程师开发进程
无代码工具正在革新AI开发,使没有广泛编码知识的个人能够高效地构建智能应用程序。这些平台简化了诸如创建RAG系统、设计多代理工作流和微调大型语言模型等流程,显著减少了开发时间和精力。文章重点介绍了六款杰出的无代码工具,它们正在赋能AI工程师和开发者。
-
OCRmyPDF教程指导可搜索PDF转换及高级功能
一项新教程详细介绍了如何使用Python工具OCRmyPDF将扫描文档转换为可搜索的PDF/A文件。该指南涵盖了侧边栏文本提取、批量处理以及优化Tesseract以提高准确性等高级功能。它还演示了清理嘈杂扫描件、纠正文档方向以及直接在内存中执行OCR的技术。
-
NVIDIA 发布 Open-SWE-Traces 数据集用于 AI 软件工程训练
NVIDIA 发布了 Open-SWE-Traces,一个旨在训练人工智能软件工程任务代理的数据集。MarkTechPost 的一项新教程演示了如何处理该数据集以进行监督微调。该教程涵盖了轨迹解析、代码补丁分析和工具使用指标评估等技术,从而能够创建高质量的训练数据。
-
从头开始构建 OpenHarness 风格的代理运行时教程
本教程深入探讨了如何从头开始构建一个受 OpenHarness 启发的代理运行时系统。它涵盖了关键组件,如带有类型模式的工具使用、权限管理、生命周期钩子、内存集成、技能定义、上下文压缩、错误处理、成本跟踪和多代理协调。该指南通过暴露从任务接收到模型动作选择、工具验证和执行的控制流,强调理解代理框架的内部工作原理,最终完成用户的任务。该实现设计为无需 API 密钥或复杂的基础设施即可运行,从而促进了对代理架构的实验。
-
GLM-5.2模型在OpenAI兼容API功能指南中得到详细介绍
本教程通过OpenAI兼容API提供了使用GLM-5.2模型的指南,重点介绍了其高级功能。它详细介绍了如何设置Together和Hugging Face等各种提供商,安全地管理API密钥,并创建一个可重用的聊天包装器。该指南演示了实际应用,包括控制推理工作量、使用流式传输获取响应、实现函数调用、构建简单的工具使用代理以及执行长上下文检索。
-
OpenAI 发布 GPT-Image-2 和 GPT-5.5 Instant 升级,以及新的网络安全工具
OpenAI 发布了 GPT-Image-2,并将其提供给 Together AI,供开发者集成到他们的应用程序中。该模型每次调用支持最多 16 张参考图像,并提供原生 1K、2K 和 4K 输出,具有高多语言文本渲染准确性。同时,OpenAI 已将其免费 ChatGPT 模型升级到 GPT-5.5 Instant,增强了其理解上下文、处理复杂查询和适应用户澄清的能力,旨在提供更自然、更连贯的响应。此外,OpenAI 还推出了 GPT…
-
Anthropic 根据美国出口管制命令暂停在全球范围内使用 Fable 5 和 Mythos 5 模型
在 2026 年 6 月中旬发布的美国出口管制指令后,Anthropic 已在全球范围内暂停了其 Fable 5 和 Mythos 5 模型。该指令以国家安全为由,要求 Anthropic 阻止外国国民访问,导致该公司由于无法实时区分而对所有用户禁用了这些模型。尽管 Anthropic 对该指令的风险定性和程序提出异议,但 Fable 5 或 Mythos 5 没有确定的恢复日期,不过 Opus 4.8、Sonnet 和 Haiku …
-
城市功能推断的空间图学习流程详解
本教程演示了如何构建一个用于城市功能推断的空间图学习流程。它利用 city2graph、OSMnx 和 PyTorch Geometric 等库来处理 OpenStreetMap 数据,构建图结构,并训练 GraphSAGE 模型。该过程包括收集兴趣点 (POI) 和街道网络数据,进行空间特征工程,并创建异构和同构图表示,以基于空间上下文预测 POI 类别。