gpt-5.6没额度了,我用deepseek-v4-flash 连续跑两天花了 14 亿 token,40人民币
把 Codex 主力模型换成 deepseek-v4-flash 的 48 小时:三个线程跑完线上验证、计费修复、CI 精简、PR review 一长串工程任务。从真实会话记录统计 token、缓存命中、reasoning 占比与交付物,和之前 gpt-5.6-sol 的会话对比,给这台便宜模型一个基于数据的评价。
共 100 篇文章
把 Codex 主力模型换成 deepseek-v4-flash 的 48 小时:三个线程跑完线上验证、计费修复、CI 精简、PR review 一长串工程任务。从真实会话记录统计 token、缓存命中、reasoning 占比与交付物,和之前 gpt-5.6-sol 的会话对比,给这台便宜模型一个基于数据的评价。
一次模拟真实场景的全量服务巡检:三个 Kubernetes 集群加外部托管服务全部采集、出拓扑图、定位问题,再对账 token 与账单。按 DeepSeek 官方单价这次巡检约 5 毛钱,缓存命中率如何决定最终成本,文中都有明细。
一台十五年前就退役的电脑,一直堆在杂物里,前些天处理掉了;留下的硬盘接上新电脑后,用户目录被旧账号的权限锁住。用 Codex 在本机完成排查,两条命令夺回所有权——这次经历也说明,NTFS 目录权限拦得住误操作,拦不住想绕过它的人。
V4-Flash 正式版上线后原生支持 Responses API 并适配 Codex。本文整理官方性能与定价,给出两种接入 Codex 的配置方式,再用 4 个本地 Agent 任务实测:全部通过、总耗时约 4 分钟、花费不到 5 分钱。
一个能完成任务的 Agent,距离真正可交付还差任务契约、交互兜底、质量门禁、安全审查、成本核算和灰度运营。本文以合同审查 Agent 为例,给出一套可以直接执行的产品化方法。
正确工具进入候选列表,只解决了工具调用链的第一小步。本文拆解召回、选择、参数、执行和结果解释五道门,用实际案例说明怎样设计工具契约、参数修复、候选裁剪和分层评测。
为什么同样的任务,GPT-5.6 Sol 会让人觉得额度掉得更快?从工具调用、缓存输入、长上下文、重试和子任务拆开一次 Agent 回合,给出一套可以自己复测的用量账本。
给 Codex 接上 MCP 只是第一步。本文实现一个代码变更影响分析工具,用 36 次真实调用比较含糊接口与语义化 Schema,拆解工具命名、参数设计、结构化输出、安全注解、错误语义和评测方法。
一个能接入真实业务的 Agent,除了模型和 Prompt,还需要任务契约、可恢复运行时、工具协议、状态与记忆、并发控制、安全边界和评测体系。本文用三个案例给出一套可落地的参考架构。
一套经过实际验证的 WSL Vulkan 学习环境:弄清 Dzn 与 Lavapipe 两条执行路径,安装工具链,枚举物理设备,编译 Shader,并建立从第一个三角形到调试、同步和小型渲染器的学习路线。
完成企业级 Agent 的最后一块设计:用 Trace 还原轨迹,用四层测试控制不确定性,把安全边界放在模型之外,并判断 ToB、ToC 与具体场景是否值得投入。
继续设计企业级 Agent 的数据和执行层:长期记忆怎样分层与遗忘,工具怎样契约化,多租户状态怎样用乐观锁、租约和幂等机制保持一致。
从 DeepSeek Agent 岗位讨论出发,拆解 Harness、企业级运行时、状态机、事务边界和上下文窗口,回答一个 Agent 怎样从演示程序变成可恢复的系统。
以一套虚构统一授权系统从设计、开发到测试跑通的完整演练为主线,拆解 Codex 如何借助 Goal、状态外置、检查点、模型档位切换和分层验收完成长任务。
从一份完整 Prompt 出发,用 Codex Sites 生成城市气象观察站,并设计 QVeris 动态工具发现、服务端调用、统一数据模型和凭证保护链路。文中包含在线地址、真实页面截图、访问限制和后续接入方案。
用一个可复制的示例,从协议选择、数据模型和接口契约开始,实现同时服务 Web、桌面 CLI、WSL、远程服务器与 API 的 OAuth 2.0/OIDC 统一授权系统。
一份面向日常开发的 Git 极简参考手册:从概念、常用命令、协作命令、高级效率命令,到分支模型、merge 与 rebase、gh、工作流、模板、图形界面、反模式和 AI 时代的用法。
用五个十分钟内能跑完的小测试,粗略判断当前 AI/Codex 会话的推理、代码理解、反幻觉和工程排查能力。