Agent 的搜索引擎:Agentic Resource Discovery 规范,以及它解决不了的信任问题
MCP 解决了 Agent 怎么调用工具,ARD 解决的是更早一环:Agent 怎么找到工具。2026 年 6 月 Google 联合微软、GitHub 等发布 ARD 规范,核心是域名下的 ai-catalog.json 和聚合注册中心。本文拆解 Catalog/Registry 机制、与 MCP/A2A 的分工,以及验证机制背后的供应链安全账。
共 24 篇文章
MCP 解决了 Agent 怎么调用工具,ARD 解决的是更早一环:Agent 怎么找到工具。2026 年 6 月 Google 联合微软、GitHub 等发布 ARD 规范,核心是域名下的 ai-catalog.json 和聚合注册中心。本文拆解 Catalog/Registry 机制、与 MCP/A2A 的分工,以及验证机制背后的供应链安全账。
2026 年端侧 AI 被反复称为元年:AI 手机出货 1.47 亿台、端侧模型装机 4200 万台、量产车里跑起座舱智能体。本文从模型、芯片、场景三个条件讲清为什么是今年,再用 roofline 模型和量化三件套解释真正的瓶颈为什么是内存带宽。
MCP 第 5 版规范把协议从有状态长连接改成无状态核心:握手没了、会话 ID 没了、请求变成自带上下文的自描述 HTTP POST。本文列出每个变更的工程含义、迁移顺序和 Akamai 指出的六类新安全风险,给正在维护 MCP server/client 的人一份可对照的清单。
Meta 在 2026 年 8 月 5 日发布首个终端编程 Agent Muse Code。本文基于官方发布与第三方公开数据整理:模型与价格、两档计费的真实成本差、三大编程基准上的名次、以及真正值得关注的 event log 与后台常驻 Agent 设计。
上一篇用 48 小时真实会话证明了它便宜又耐用,这篇拆到适配层看它为什么能被 Codex 用好:~/.codex/models.json 的每个字段怎么改变客户端行为,1.77 万字符的 instructions_template 怎么把模型变成合格的 Codex 代理,以及 DeepSeek Harness 的内测招募、官方基准和社区猜测。
把 Codex 主力模型换成 deepseek-v4-flash 的 48 小时:三个线程跑完线上验证、计费修复、CI 精简、PR review 一长串工程任务。从真实会话记录统计 token、缓存命中、reasoning 占比与交付物,和之前 gpt-5.6-sol 的会话对比,给这台便宜模型一个基于数据的评价。
一次模拟真实场景的全量服务巡检:三个 Kubernetes 集群加外部托管服务全部采集、出拓扑图、定位问题,再对账 token 与账单。按 DeepSeek 官方单价这次巡检约 5 毛钱,缓存命中率如何决定最终成本,文中都有明细。
V4-Flash 正式版上线后原生支持 Responses API 并适配 Codex。本文整理官方性能与定价,给出两种接入 Codex 的配置方式,再用 4 个本地 Agent 任务实测:全部通过、总耗时约 4 分钟、花费不到 5 分钱。
一个能完成任务的 Agent,距离真正可交付还差任务契约、交互兜底、质量门禁、安全审查、成本核算和灰度运营。本文以合同审查 Agent 为例,给出一套可以直接执行的产品化方法。
正确工具进入候选列表,只解决了工具调用链的第一小步。本文拆解召回、选择、参数、执行和结果解释五道门,用实际案例说明怎样设计工具契约、参数修复、候选裁剪和分层评测。
为什么同样的任务,GPT-5.6 Sol 会让人觉得额度掉得更快?从工具调用、缓存输入、长上下文、重试和子任务拆开一次 Agent 回合,给出一套可以自己复测的用量账本。
llms.txt 到底是什么,和 robots.txt、sitemap、OpenAPI 有什么区别?本文结合 OpenAI、Anthropic、Cloudflare、Supabase、Vercel、Stripe 与 FastHTML 的公开文件,拆解格式、分层、生成、校验和上线后的最佳实践。
给 Codex 接上 MCP 只是第一步。本文实现一个代码变更影响分析工具,用 36 次真实调用比较含糊接口与语义化 Schema,拆解工具命名、参数设计、结构化输出、安全注解、错误语义和评测方法。
一个能接入真实业务的 Agent,除了模型和 Prompt,还需要任务契约、可恢复运行时、工具协议、状态与记忆、并发控制、安全边界和评测体系。本文用三个案例给出一套可落地的参考架构。
完成企业级 Agent 的最后一块设计:用 Trace 还原轨迹,用四层测试控制不确定性,把安全边界放在模型之外,并判断 ToB、ToC 与具体场景是否值得投入。
继续设计企业级 Agent 的数据和执行层:长期记忆怎样分层与遗忘,工具怎样契约化,多租户状态怎样用乐观锁、租约和幂等机制保持一致。
从 DeepSeek Agent 岗位讨论出发,拆解 Harness、企业级运行时、状态机、事务边界和上下文窗口,回答一个 Agent 怎样从演示程序变成可恢复的系统。
以一套虚构统一授权系统从设计、开发到测试跑通的完整演练为主线,拆解 Codex 如何借助 Goal、状态外置、检查点、模型档位切换和分层验收完成长任务。
现在技术圈真正热的,不是又出了一个模型,而是 AI Coding Agent 开始进入真实开发流程:接任务、改仓库、跑测试、提 PR,也把上下文、安全和 review 这些老问题重新推到台前。
浏览器 Agent 从能看网页走到能点按钮、填表单、提交操作,产品价值变大了,误操作和越权风险也同步变大。守护栏要比自动化能力先成熟。
Agent 系统不再只是写一段提示词。真正决定效果的,是如何选择、裁剪、排序和验证上下文,让模型在每一步拿到刚好够用的信息。
MCP 让 AI 应用接工具变得统一,但工具一旦能读文件、查数据库、发请求,安全问题就从接口规范变成了权限、身份、审计和供应链问题。
Agent 系统出错时,最终回答往往看不出原因。要调试生产 Agent,必须记录任务、工具、上下文、成本、重试和每一步证据。
Cursor 新发布的 TypeScript SDK 把 IDE、CLI 和 Cloud Agents 背后的 agent 能力开放成可编程接口。本文梳理它的运行时、hooks、MCP、示例仓库和适用场景,并用一个 CI 自动修复失败 PR 的例子说明怎么落地。