浏览器 Agent 能做事以后,第一件事不是放权
浏览器 Agent 从能看网页走到能点按钮、填表单、提交操作,产品价值变大了,误操作和越权风险也同步变大。守护栏要比自动化能力先成熟。
共 149 篇文章
浏览器 Agent 从能看网页走到能点按钮、填表单、提交操作,产品价值变大了,误操作和越权风险也同步变大。守护栏要比自动化能力先成熟。
Agent 系统不再只是写一段提示词。真正决定效果的,是如何选择、裁剪、排序和验证上下文,让模型在每一步拿到刚好够用的信息。
端侧 AI 不是云端大模型的缩小版。它关心的是延迟、功耗、隐私、缓存和产品边界,也需要开发者重新适应一套更贴近设备的工程约束。
RAG 系统上线后,关键不在能不能答,而在什么时候答错、为什么答错、错得有没有边界。评估要拆开检索、证据、生成和拒答。
从 Codex app-server 的协议边界讲起,分析它适合嵌入哪些产品与工程场景,也比较 Claude Code、Cursor 在脚本化、云端 Agent 和自定义集成上的相近能力。
在本地测试机上通过 Ollama 跑 gemma4:12b,先用三版分形树 prompt 测代码生成,再接入 OpenClaw + QVeris 做真实数据调用,复盘这个 12B 本地模型的可用性、速度和边界。
用一次真实 Codex 长会话的 token 与价格统计,拆解哪些对话最贵、为什么长上下文会拖高成本,以及如何通过拆会话、压日志、用文件和沉淀规则来优化。
从真实使用出发,回答 Codex collaboration mode、GPT-5.3-Codex-Spark、statusline、skills、slash commands、codex exec 和 Codex SDK 这些容易混淆的问题。
把最近一段时间用 Codex、Claude Code、Cursor、gh、lark-cli 做真实工程任务的过程脱敏整理成一篇复盘:哪些事适合交给 AI,哪些边界必须守住,以及怎样让 AI 的工作可验证、可交付。
公司里居然有两台闲置的 RTX 4090 机器,这篇记录如何把它们用起来:从 NVIDIA 驱动、代理服务、Ollama 部署、模型下载,到 API 测试和模型能力评估。
Cursor 的 Composer 2 在实际使用中可以触发生图,而官方 changelog 指向 Google Nano Banana Pro。本文记录这种编程工具里的生图工作流、成本判断,并用 Codex 生成图做同画幅对比。
从 Codex 与 Cursor 的产品边界讲起,比较 Codex IDE、Codex CLI、Cursor 中 Codex 插件的优缺点,回答 Skills 与 Cursor 会话上下文能否互通,并给出一套实用的共生工作流。
Cursor 新发布的 TypeScript SDK 把 IDE、CLI 和 Cloud Agents 背后的 agent 能力开放成可编程接口。本文梳理它的运行时、hooks、MCP、示例仓库和适用场景,并用一个 CI 自动修复失败 PR 的例子说明怎么落地。
Hermes 把技能写成磁盘上的 SKILL.md,用 skill_manage 改它;加载时分层拉取,避免一次塞满上下文。文中有几段按官方文档条件编出来的小故事,帮助理解 patch 和 create 在什么情况下会出现。
装 Hermes 要注意什么、模型怎么接;用一节把与 OpenClaw 的差异写细(技术栈、ClawHub/插件、控制台 vs 终端、渠道与迁移)。文末仍是国内模型与微信文档入口。
从工具链角度讨论:Cursor 能否参与长篇网文创作,工程化如何保证前后一致,上下文窗口与 token 成本怎么取舍,并给出一套仓库结构与日常流程。
合并 v2026.3.22-beta.1 与 v2026.3.22:插件安装优先 ClawHub、浏览器扩展 relay 移除、image_generate 与 SDK 迁移、可插拔沙箱与 SSH、GPT-5.4 默认与多路搜索/模型插件,以及大量网关与安全硬化。
装好 OpenClaw(龙虾)、onboard 与网关自检,再用微信 ClawBot 插件扫码接入。