文章归档

第 2 页。归档页按时间倒序展示,每页只加载一组文章封面,减少首屏压力。

文章列表

AI 巨头集体踩刹车:这一脚踩在了错误的车轮上
原创 人工智能 · 工程实践 · 阅读 —

AI 巨头集体踩刹车:这一脚踩在了错误的车轮上

Anthropic、OpenAI、Google 罕见同声呼吁放慢前沿 AI。拆解阿莫迪的三步方案为何没写下一个速度数字,以及真正会让 AI 减速的是电网和折旧表,不是董事会的新闻稿。

技术热点透视20260913:AI 编程 Agent 的沙箱,漏了
原创 人工智能 · 工程实践 · 阅读 —

技术热点透视20260913:AI 编程 Agent 的沙箱,漏了

一行 .git/config 就能让 AI 编程 Agent 在你说「信任」之前替你跑起别人的命令。Manifold Security 的 GitSpawn 让 7 个主流 Agent 全线失守;同期安全初创 Accomplish 通报的「沙箱泄漏」里,Cursor、OpenAI 约一周修完,Anthropic 花了约 50 天、30 个版本。当 Agent 已坐到你的 SSH key 旁边,沙箱这道最后的闸门,自己先漏了——这不是「又修了个 bug」,而是 Agent 安全正从功能变成采购条款。

技术热点透视20260912:当 25 位菲尔兹奖得主联名反对 AI 做数学
原创 人工智能 · 工程实践 · 阅读 —

技术热点透视20260912:当 25 位菲尔兹奖得主联名反对 AI 做数学

9 月 12 日凌晨,25 位菲尔兹奖得主(含 2026 新科得主邓煜、Deligne、吴宝珠)联名公开信,抨击 OpenAI、Anthropic 把攻克千禧年难题当基准与 IPO 前公关素材,称其伤害数学共同体。争议核心不是「AI 能不能做数学」,而是当自主研究 Agent 跑出证明,跑了三百年的优先权、署名权、同行评议制度是否还成立;数学界本周重新撞上的「身份/授权/审计/信用」四问,与生产级商业 Agent(蚂蚁 APASS/KYA)要解的是同一组治理难题。

OpenAI 把 Codex 的引擎交出来了:Agents API 公测,两个零,与一处没写在标题里的保留
原创 人工智能 · 工程实践 · 阅读 —

OpenAI 把 Codex 的引擎交出来了:Agents API 公测,两个零,与一处没写在标题里的保留

2026 年 9 月 10 日 OpenAI 开放 Agents API 公测,把驱动 Codex 的 harness 作为托管服务交给开发者:单端点创建生产级云 agent,OpenAI 负责会话保活、上下文自动压缩、故障恢复与子 agent 协调,执行环境可选托管沙箱、自有基础设施或九家合作方。本文讲清基本介绍、优点、缺点、六个坑、安全与数据边界(美国驻留、不支持 ZDR),并用可复现的成本模型算出容器空转、缓存重算 12.5 倍、272K 定价悬崖、子 agent 放大 4.54 倍等真实数字,最后回答个人开发者到底用不用得上、什么场景值得上。

别再盲飞:Anthropic 的 Agent 评估方法论,与它没说的那一半
原创 人工智能 · 工程实践 · 阅读 —

别再盲飞:Anthropic 的 Agent 评估方法论,与它没说的那一半

Anthropic 工程博客 2026 年 1 月发布《Demystifying evals for AI agents》,把「怎么知道 agent 到底行不行」拆成可执行的工程流程:task/trial/transcript/outcome/grader/harness 八个词的定义、三类评分器的分层组合、能力评估与回归评估的分工、pass@k 与 pass^k 的区别。本文做完整解读,并补上社区的四盆冷水(基准数据污染、统计功效不足、harness 自身失控、只做离线不做线上),以及四类真实业务场景(知识库研究、客服对话、编码、无人值守自动化)的落地做法。

技术热点透视20260911:编程模型杀进「性价比」时代
原创 人工智能 · 工程实践 · 阅读 —

技术热点透视20260911:编程模型杀进「性价比」时代

9 月 10 日 Cognition 发布编程模型 SWE-2:底座是月之暗面开源的 Kimi K3(2.8T 参数),后训练逼近前沿,FrontierCode 1.1 距 Fable 5.1 仅 0.9 分、成本约低 64%,距 GPT-6 Astra 差 3.3 分、成本约 1/4;Terminal-Bench 2.1 达 92.8% 全场最高,但最难的长程任务 Terminal-Bench 4.0 仅 27.3%(前沿约 56)。核心信号:编程模型竞争从「谁更聪明」翻篇到「离前沿足够近时谁更便宜」,护城河从预训练底座转移到后训练 RL 配方 + harness + 数据飞轮;分发上不卖 API、只绑 Devin 订阅(20 美元/月无限用)。

技术热点透视20260910:具身智能,终于开始「真上岗」
原创 人工智能 · 工程实践 · 阅读 —

技术热点透视20260910:具身智能,终于开始「真上岗」

9 月 9 日开幕的外滩大会 2026(上海,9/9–9/12),300 多家企业、1.5 万㎡展区,最显眼的变化是机器人不再跳舞弹琴,而是上岗当「打工人」:蚂蚁灵波人形机器人在 80cm 宽货架通道分拣药品、已落地上海国大药房真实门店;「一脑多机」让同一大脑驱动药房/仓库/工厂多形态设备;复旦眸深、擎朗、开普勒在制造业与高危巡检真实工位落地;生活智能体「阿宝」把服务入口从 App 换成一句话。评价标准从「能做什么」滑向「做什么划算、稳不稳」。但泛化性(产线 99.9% 可靠)、成本账(TCO 尚未低于人力)、非标集成(MES/ERP 重接)仍是三道真坎。同日小鹏 IRON 全球首条通用人形机器人自动化产线启用(自动化率超 80%)、优必选约 600 台 Walker S2 复购、WRC 采购日 49 家央企带真实场景——具身智能正复刻自动驾驶节奏:先资本叙事、再真实订单、最后规模毛利,当前更靠近量产验证而非规模盈利。胜负手在稳定交付,不在模型炫技。

给 AI Agent 造笼子的人,正在卷到 60 毫秒
原创 人工智能 · 工程实践 · 阅读 —

给 AI Agent 造笼子的人,正在卷到 60 毫秒

腾讯云 CubeSandbox 全栈开源之后,重新盘了一遍 2026 还在活跃的开源 AI Agent 沙箱:腾讯 CubeSandbox、阿里 OpenSandbox、CNCF agent-sandbox、E2B、Daytona,以及被忽略的本地进程级派(bubblewrap/Landlock/srt)和 WASM 边缘。结论:接口层正在收敛到 E2B,沙箱从“选型”走向“换 driver”。

AI 会写小说、会谱曲了吗?
原创 人工智能 · 工程实践 · 阅读 —

AI 会写小说、会谱曲了吗?

短篇能打、长篇会飘;Suno v5.5 与 Mureka V9.5 跨过了像不像,正撞上可控、可编辑、可确权三道墙。把'能生成'和'能创作'拆开看,会发现小说和音乐卡在同一道坎上——有状态的迭代。

技术热点透视20260908:机器人自己打起来了
原创 人工智能 · 工程实践 · 阅读 —

技术热点透视20260908:机器人自己打起来了

9 月 7 日宇树科技发布视频:两台人形机器人「全自主搏击」,靠 UnifoLM-X2-1.0「世界-动作」大模型做瞬时规划、决策和动态交互,实时预测对手下一步并规划自己的动作,无遥操作、无预设剧本。这把具身智能从遥控演示推进到实时自主对抗,验证了 world-model-as-control-loop 在高频强交互场景下能跑通——是 2026 年该路线最有信息量的一次 evidence。但冷静看,它验证的是控制层与规划层(毫秒级闭环、动态平衡、实时博弈),不是泛化层(换个零件、换间屋子还能不能行)。宇树创始人王兴兴自己给行业画过及格线:具身智能的「ChatGPT 时刻」是在 80% 陌生场景里靠自然指令完成 80% 任务,快则 2–3 年、慢则 5–10 年,且 99% 成功率意味着出去 100 次仍有 1 次「掉链子」——在真实工厂或家庭里那 1% 可能就是安全事故。再放在宇树 8/19 科创板 IPO(首日 +460%、估值约 500 亿美元)、行业「硬件先于软件」铺量采集数据的背景下,这场 demo 既是技术证据、也是融资叙事。结论:该为世界模型鼓掌,但别把 demo 当交付;demo 越炫,越要问「在没人兜底的真实场景里,它第几次掉链子」。