分类: 工程实践

共 34 篇文章

Agent 的搜索引擎:Agentic Resource Discovery 规范,以及它解决不了的信任问题
原创 人工智能 · 工程实践 · 阅读

Agent 的搜索引擎:Agentic Resource Discovery 规范,以及它解决不了的信任问题

MCP 解决了 Agent 怎么调用工具,ARD 解决的是更早一环:Agent 怎么找到工具。2026 年 6 月 Google 联合微软、GitHub 等发布 ARD 规范,核心是域名下的 ai-catalog.json 和聚合注册中心。本文拆解 Catalog/Registry 机制、与 MCP/A2A 的分工,以及验证机制背后的供应链安全账。

Bun 是什么,为什么它现在是 AI 编程工具的地基
原创 工程实践 · 行业观察 · 阅读

Bun 是什么,为什么它现在是 AI 编程工具的地基

从 2021 年的“更快 JavaScript 运行时”到 2026 年 Anthropic 收购、成为 Claude Code 的基础设施,再到用 Claude Code 把自己重写成 Rust。这篇讲清 Bun 的基本概念、它要解决的 Node 工具链痛点、1.3 时代的全栈能力,以及收购和重写背后的趋势判断。

Markdown 必知必会:日常写作与文档的参考手册
原创 工程实践 · 阅读

Markdown 必知必会:日常写作与文档的参考手册

Markdown 参考手册:每个语法都配「写法代码 + 渲染结果」对照,覆盖标题、段落与换行、强调、列表、链接、图片、引用、代码块、表格、分割线、转义、脚注、公式等基础与进阶语法,附平台差异、工程实践、lint 校验和一页速查表。

MCP 2026-07-28 迁移清单:去掉握手和会话之后,你的服务器要改什么
原创 人工智能 · 工程实践 · 阅读

MCP 2026-07-28 迁移清单:去掉握手和会话之后,你的服务器要改什么

MCP 第 5 版规范把协议从有状态长连接改成无状态核心:握手没了、会话 ID 没了、请求变成自带上下文的自描述 HTTP POST。本文列出每个变更的工程含义、迁移顺序和 Akamai 指出的六类新安全风险,给正在维护 MCP server/client 的人一份可对照的清单。

deepseek-v4-flash 为什么适配 Codex 这么好,以及deepseek的Harness
原创 人工智能 · 工程实践 · 阅读

deepseek-v4-flash 为什么适配 Codex 这么好,以及deepseek的Harness

上一篇用 48 小时真实会话证明了它便宜又耐用,这篇拆到适配层看它为什么能被 Codex 用好:~/.codex/models.json 的每个字段怎么改变客户端行为,1.77 万字符的 instructions_template 怎么把模型变成合格的 Codex 代理,以及 DeepSeek Harness 的内测招募、官方基准和社区猜测。

gpt-5.6没额度了,我用deepseek-v4-flash 连续跑两天花了 14 亿 token,40人民币
原创 人工智能 · 工程实践 · 阅读

gpt-5.6没额度了,我用deepseek-v4-flash 连续跑两天花了 14 亿 token,40人民币

把 Codex 主力模型换成 deepseek-v4-flash 的 48 小时:三个线程跑完线上验证、计费修复、CI 精简、PR review 一长串工程任务。从真实会话记录统计 token、缓存命中、reasoning 占比与交付物,和之前 gpt-5.6-sol 的会话对比,给这台便宜模型一个基于数据的评价。

5毛钱的 deepseek-v4-flash 能干什么
原创 人工智能 · 工程实践 · 阅读

5毛钱的 deepseek-v4-flash 能干什么

一次模拟真实场景的全量服务巡检:三个 Kubernetes 集群加外部托管服务全部采集、出拓扑图、定位问题,再对账 token 与账单。按 DeepSeek 官方单价这次巡检约 5 毛钱,缓存命中率如何决定最终成本,文中都有明细。

旧笔记本的硬盘接上新电脑,盘没坏,是锁给错了人
原创 工程实践 · 阅读

旧笔记本的硬盘接上新电脑,盘没坏,是锁给错了人

一台十五年前就退役的电脑,一直堆在杂物里,前些天处理掉了;留下的硬盘接上新电脑后,用户目录被旧账号的权限锁住。用 Codex 在本机完成排查,两条命令夺回所有权——这次经历也说明,NTFS 目录权限拦得住误操作,拦不住想绕过它的人。

DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱
原创 人工智能 · 工程实践 · 阅读

DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱

V4-Flash 正式版上线后原生支持 Responses API 并适配 Codex。本文整理官方性能与定价,给出两种接入 Codex 的配置方式,再用 4 个本地 Agent 任务实测:全部通过、总耗时约 4 分钟、花费不到 5 分钱。

Agent 做出来了,接下来怎么上线
原创 人工智能 · 工程实践 · 阅读

Agent 做出来了,接下来怎么上线

一个能完成任务的 Agent,距离真正可交付还差任务契约、交互兜底、质量门禁、安全审查、成本核算和灰度运营。本文以合同审查 Agent 为例,给出一套可以直接执行的产品化方法。

Agent 找到工具以后,为什么还是会用错
原创 人工智能 · 工程实践 · 阅读

Agent 找到工具以后,为什么还是会用错

正确工具进入候选列表,只解决了工具调用链的第一小步。本文拆解召回、选择、参数、执行和结果解释五道门,用实际案例说明怎样设计工具契约、参数修复、候选裁剪和分层评测。

GPT-5.6 Sol 的额度去哪了
原创 人工智能 · 工程实践 · 阅读

GPT-5.6 Sol 的额度去哪了

为什么同样的任务,GPT-5.6 Sol 会让人觉得额度掉得更快?从工具调用、缓存输入、长上下文、重试和子任务拆开一次 Agent 回合,给出一套可以自己复测的用量账本。

怎样让 Codex 真正会用你的工具
原创 人工智能 · 工程实践 · 阅读

怎样让 Codex 真正会用你的工具

给 Codex 接上 MCP 只是第一步。本文实现一个代码变更影响分析工具,用 36 次真实调用比较含糊接口与语义化 Schema,拆解工具命名、参数设计、结构化输出、安全注解、错误语义和评测方法。

企业级 Agent 的七层底座
原创 人工智能 · 工程实践 · 阅读

企业级 Agent 的七层底座

一个能接入真实业务的 Agent,除了模型和 Prompt,还需要任务契约、可恢复运行时、工具协议、状态与记忆、并发控制、安全边界和评测体系。本文用三个案例给出一套可落地的参考架构。

在 WSL 里把 Vulkan 跑起来
原创 图形编程 · 工程实践 · 阅读

在 WSL 里把 Vulkan 跑起来

一套经过实际验证的 WSL Vulkan 学习环境:弄清 Dzn 与 Lavapipe 两条执行路径,安装工具链,枚举物理设备,编译 Shader,并建立从第一个三角形到调试、同步和小型渲染器的学习路线。

Agent面试详解(下):评测、安全与落地判断
原创 人工智能 · 工程实践 · 阅读

Agent面试详解(下):评测、安全与落地判断

完成企业级 Agent 的最后一块设计:用 Trace 还原轨迹,用四层测试控制不确定性,把安全边界放在模型之外,并判断 ToB、ToC 与具体场景是否值得投入。

让 Codex 连续干几天,靠的不是一条超长 Prompt
原创 人工智能 · 工程实践 · 阅读

让 Codex 连续干几天,靠的不是一条超长 Prompt

以一套虚构统一授权系统从设计、开发到测试跑通的完整演练为主线,拆解 Codex 如何借助 Goal、状态外置、检查点、模型档位切换和分层验收完成长任务。

用 Codex Sites 搭一个能调用 QVeris 的天气网站
原创 人工智能 · 工程实践 · 阅读

用 Codex Sites 搭一个能调用 QVeris 的天气网站

从一份完整 Prompt 出发,用 Codex Sites 生成城市气象观察站,并设计 QVeris 动态工具发现、服务端调用、统一数据模型和凭证保护链路。文中包含在线地址、真实页面截图、访问限制和后续接入方案。

给 Web、CLI 和远程服务器做一套统一授权
原创 工程实践 · 阅读

给 Web、CLI 和远程服务器做一套统一授权

用一个可复制的示例,从协议选择、数据模型和接口契约开始,实现同时服务 Web、桌面 CLI、WSL、远程服务器与 API 的 OAuth 2.0/OIDC 统一授权系统。

Git 必知必会:开发者实战手册
原创 工程实践 · 阅读

Git 必知必会:开发者实战手册

一份面向日常开发的 Git 极简参考手册:从概念、常用命令、协作命令、高级效率命令,到分支模型、merge 与 rebase、gh、工作流、模板、图形界面、反模式和 AI 时代的用法。

埋点这件事,别等系统跑起来才想
原创 工程实践 · 阅读

埋点这件事,别等系统跑起来才想

从小服务到高流量平台,聊清楚服务埋点为什么要做,前端、后端、网关和队列各自怎么采,PostgreSQL、MongoDB、ClickHouse 如何选,成本和性能怎样估算。

接口服务里的 A/B Test:从灰度开关到可信实验
原创 工程实践 · 阅读

接口服务里的 A/B Test:从灰度开关到可信实验

A/B test 不只是前端页面实验。接口服务里的策略、排序、限流、供应商选择和成本控制同样需要实验纪律:稳定分桶、真实曝光、跨请求归因、护栏指标和实验收尾。

向量检索的准确性:从一次搜不准说起
原创 工程实践 · 阅读

向量检索的准确性:从一次搜不准说起

向量检索不是把所有字段拼起来扔给 embedding 模型就结束了。本文用一个虚构的 API 工具市场做例子,拆解噪声文本、长描述、URL、阈值、混合召回和评估集如何影响检索质量,并总结一套可复用的最佳实践。

从 0 到 1:用 Cursor 搭一个开源证件照排版服务 zipress
原创 工程实践 · 阅读

从 0 到 1:用 Cursor 搭一个开源证件照排版服务 zipress

记录 zipress 的完整落地:需求与选型、Next.js + FastAPI 双栈、真实 Cursor 对话摘录、架构与用户路径流程图(PNG)、统一/混排导出对比、部署与开源仓库;附特性总结与未来 TODO。

Cursor 中的开发流程自动化实战
原创 工程实践 · 阅读

Cursor 中的开发流程自动化实战

飞书 CLI、Issue 与 Skill 之外,顺手记几条在 Cursor 里常做的「流程活」:gh 看 PR、跑测试、MCP 浏览器点一遍、统计脚本对接飞书,以及多文件改动时怎么让 Agent 跟着仓库约定走。

用 LLM 做大规模分类:从暴力遍历到层级剪枝的实战优化
原创 工程实践 · 阅读

用 LLM 做大规模分类:从暴力遍历到层级剪枝的实战优化

当你需要用 LLM 给成千上万个实体自动打标签,朴素做法的成本可能高到离谱。这篇文章从一个真实的自动分类脚本出发,拆解六种可复用的优化手段:层级剪枝、继承传播、批量合并、增量跳过、祖先回填和 prompt 缓存。附成本对比和通用化思路。