AI 会写小说、会谱曲了吗?
古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com
这两年被问过太多次”大模型能不能写小说""能不能谱曲”,每次我的回答都不太一样:技术上能,效果上分场景,长期上还差关键几步。我自己做过一些类似的尝试,所以下面说的不是看客感慨,是手感和工程代价混在一起的判断。结论先放在前面:AI 已经会生成合格的小说段落和像样的旋律片段,但要谈”创作”还隔着五道坎——连贯、风格、可控、可确权、最后才是”对作品负责”。把它当打字机已经很值钱了;把它当合作者,需要先把这五道坎认出来。
01小说这边:30 章魔咒,与一个正在被工程化的解法
先说小说,因为这件事这两年数据最硬。最有杀伤力的一组数据来自 Stony Brook 大学 2026 年的一项研究:研究团队在 Amazon 上随机抽了 14,419 本自出版小说电子书,用 Pangram 这类检测工具扫全文,结果发现 20% 的样本里含超过 25% 的 AI 生成文本,9% 甚至超过 90%。
但真正有意思的不是”AI 书有多少”,而是它们在怎么卖。研究匹配了三大出版集团之一的日销售数据,发现 2026 年 AI 小说已经拿下品类小说总销量的约 20%,畅销榜上三分之一的新面孔里都看得到 AI 的影子。最贵的一本单年卖出 8 万多册,营收约 64.3 万美元;有个作者 8 本书 12 个月内合计收入约 170 万美元。这些不是灌水文,是真正进了读者钱包的。
在类型小说里,人们用 AI 写这些书,读者根本分不出来。 ——Tuhin Chakrabarty,Stony Brook 计算机科学教授,研究负责人
另一边的盲测在印证同一件事:《纽约时报》2026 年初搞过一次 86,000 人规模的对照测试,让读者分辨文学、历史、诗歌里哪些段落是 AI 写的,结论是约一半人分错,54% 的人甚至更喜欢 AI 那一版。奇幻作家 Mark Lawrence 把四篇 AI 短篇塞进 Robin Hobb 等名家作品里让粉丝投票,964 票里多数连猜都猜不准。雨果奖得主郝景芳最近也公开承认,新作《银河学院》有一半内容由 AI 生成,编辑和读者都没看出来。
看起来”AI 写小说已经成了”,但这层光鲜下面有两条裂缝:
第一道裂缝:卖得动 ≠ 写得好。Stony Brook 的数据有个反直觉的细节——AI 书的销量增长是数量堆出来的,季度单本平均收入其实在下降。换句话说,是”十万个账号各写十本”淹没了市场,而不是”AI 突然学会了写伟大的小说”。研究还发现一个非常机器的痕迹:销量越高的 AI 书,越喜欢复用一些训练语料里的”稀有表达”——一模一样的五词短语会出现在不同作者的不同书里,比如”They collapsed together, a tangle of sweat-slicked limbs and racing hearts”原样照抄。这本质上是高质量训练片段的拼贴,而不是创作。
第二道裂缝:长篇会飘,且飘是架构性的。业内把”写到 30 章后人设、伏笔、设定全乱”叫做三十章魔咒,这事在写作圈有大量实锤案例。原因不是模型”不认真”,而是注意力权重在前向传播时就定下了,无法在第二十章揭示第三章伏笔重要性之后,回过头去给第三章重新加权。上下文窗口再大,本质问题没变:它处理信息是”累积”的,不是”转换”的。这是大语言模型架构层面的事,不是堆参数能解决的。
工程上正在被验证的解法是把状态外置。Noveling、Sudowrite、Novelcrafter、Jenova Creative Fiction Writer 这类工具做的事高度一致:把”人物档案、世界规则、未回收的伏笔、禁忌清单”做成外挂的状态台账,每章生成前先检索、压缩、喂入。最戏剧化的对照来自 SCORE 论文:基线模型在”物品/设定是否仍在场景里”这类事实题上得零分,加上显式状态追踪后干到 90 多;但同样的改造只把”叙事连贯性”这个更软的指标拉高了 2 到 8 分。
这把两类问题切得非常干净:工具已经解决了”事实连续性”这一半——谁有什么、谁知道什么、什么时间发生了什么;剩下”意义连续性”那一半——为什么这件事重要、为什么必须是这个角色、为什么结局从开头就不可避免——还是作者的活。Kenyon College 的 Katherine Elkins 用了”eerie placidity”(诡异的平静)来形容 AI 文本在情绪上的空白,这是更内行的一种说法:AI 能写出”他沉默了很久”,但写不出读者为什么会被这段沉默击中。
图 1 · 左半边是模型原生输出——章节一多,注意力覆盖不到早期内容,事实与人设开始漂移;右上方那块外置的状态台账是今天所有严肃 AI 写作工具真正在拼的东西。但意义层面的连贯性,仍然只有人能兜。
中文世界这边还有一道墙是监管。2026 年 6 月 10 日,番茄小说发了一个让网文圈地震的公告:49 位金番作者因 AI 全篇代写被处罚,17 个账号永久封禁。把时间线串起来看:番茄 5 月拒签 11.27 万本低质 AI 稿,下架 4 万多部;7 月进一步拒签 16 万本,处置近 5.4 万本,封号 5621 个;起点 8 月直接从月票榜前 1000 撤掉了约 100 本 AI 痕迹过重的作品,连高订 8.7 万、均订 3.2 万的头部都没幸免。检测技术也跟着升级:起点的”墨瞳”不再看词密度,而是情绪梯度、伏笔回收节奏、角色动机一致性等 17 项人类写作的”生物特征”;番茄的”朱雀”对外宣称准确率 95% 以上。4 月阅文、番茄、晋江、七猫等 16 家头部平台已经共同签了《网络文学行业反洗稿自律公约》,把”AI 辅助创作使用规范”写进了行业宪章。
这里有一个我自己反复试过之后才慢慢相信的判断:中文网文平台的规则不是反 AI,是反”工业糖精”——大批量、低差异、用规模稀释读者注意力的生成模式。AI 当打字机、查资料、理大纲被允许,AI 整章代写、AI 多账号灌水、AI 托管账号无论怎么改写都被锤。平台砍的是地基被冲刷的风险,不只是工具本身。
02音乐这边:先跨过了"像不像",正在跨"能不能改"
音乐的故事节奏跟小说不一样。音乐这条线起步晚但跨得更快,原因在于音乐生成天然就是”波形 + 符号”两条腿,AI 在波形这一腿上的进展比语言模型在长文本上的进展更早触到可用线。
先说海外。Suno 在 2026 年 3 月 26 日发了 v5.5,加了自定义声音克隆、个人化模型训练、被动偏好学习 My Taste,能稳定输出 8 分钟以上录音室品质的完整曲目;到 2 月已经有 200 万付费订阅、3 亿美元 ARR,估值 54 亿美元。Udio 走的是另一条路——给前 Spotify AI 研究员做的,更偏创作者,擅长段落级编辑、inpainting、风格参考。
真正有意思的变化不在产品端,在产权端。2025 年底开始,版权格局被三个和解重新画了一遍:Udio 先在 10 月和环球音乐(UMG)达成和解,紧接着 11 月华纳(Warner)和 Suno、Udio 同时签约。结果是市场被一刀切成了两类——Suno 体系下付费用户拿到商用授权,作品能带文件出去发到 Spotify、YouTube、TikTok;Udio 体系下音频、视频、stem(分轨)下载被整体关停,作品只能在平台围墙内流转。2026 年 7 月索尼又单独把 Udio 告上法庭,指训练数据里识别出 30,117 首索尼曲目,授权谈判变成一连串而不是一次。
国内的牌面是昆仑万维的 Mureka。这条线 2026 年的迭代节奏非常密:1 月 V8 一举登顶 Artificial Analysis 的 Vocals 和 Instrumental 双榜,3 月 27 日中关村论坛上发 V9,7 月 19 日 WAIC 又发 V9.5 + O3 音乐大模型。技术核心是 MusiCoT(Music Chain-of-Thought)——模型在渲染音频前,先用思维链把歌曲的曲式结构、段落设计、表达意图规划清楚,再去做音频生成。V9.5 引入了 O3,把”一次性规划”升级成”持续推演”——生成过程不断回看偏差、修正后续决策。在昆仑万维自己的口径里,V9.5 的综合表现已经超过 Suno v5.5 和 Google Lyria 3 Pro。中文场景里特别提一句:Mureka 的国风优化是行业第一档,中文咬字、长句气口、民族配器还原都明显脱掉了合成感。
音乐这边的差距比小说小一些,但同样有自己的三道坎:
第一道:可控性。默认输出听起来都”像一首歌”了,但段落级控制(让副歌别那么高亢、让第二段桥接部换个调)仍然吃力。Mureka V9 把”段落内文本控制”列为重点改造项,提示词控制良品率能到 97%,但这只是工程指标的胜利,离”作曲家能精准指挥”还有距离。
第二道:可编辑性。AI 出的更多是”渲染好的成品”,不是”可改的工程”。Suno Studio 把多轨编辑、BPM 控制、stem 生成、MIDI 导出塞进 Premier 档,本质是在补救这一层——让生成结果可以进 DAW(数字音频工作站)继续改。Mureka 的 Pro 计划也跟上 stems、MIDI、WAV 导出。这条路走通之前,AI 音乐只能当 demo;走通之后,才是生产工具。
第三道:可确权。音乐比小说更早撞到”产权”这堵墙,因为训练数据有指纹、可比对、能溯源。Suno 与 Warner 的协议里写明:未授权模型会在 2026 年内被逐步淘汰,取而代之的是全授权模型。Suno 在和环球、索尼的诉讼里仍在抗辩”transformative fair use”,同时也在抵抗对方把 61,000 首录音加入证据清单的请求。这场判决的价格不止属于音乐行业——任何模态的训练数据授权条款,最终都会参考这场。
图 2 · 左到右是 AI 音乐正在逐道迈过的门槛——输入意图、结构规划、波形渲染、可编辑工程、最后是授权清晰。前面四道过去一年都有进展,第五道还取决于法庭和唱片公司的谈判节奏。
03两件事其实是同一个问题
把小说和音乐放一起看,规律会变得非常清楚:
| 环节 | 小说 | 音乐 |
|---|---|---|
| 单次生成 | 已经非常可用 | 已经非常可用 |
| 结构性规划 | 外部大纲/故事圣经 | 内置 MusiCoT(先规划再渲染) |
| 长期一致性 | 外挂状态台账(事实/伏笔/人设) | 段落级控制 + 风格参考 |
| 可编辑可改 | 人工改写为主 | stem/MIDI 导出进 DAW |
| 可确权可分发 | 平台审核 + 反洗稿公约 | 唱片公司授权 + 模型折旧 |
两条线收敛到同一个形态:创作 = 有状态的迭代,而不是一次采样。能生成只是入场券,不能迭代就不是创作。Mureka 的 MusiCoT 把”结构规划”内化进模型,等于小说界开始给模型挂上故事圣经;小说侧把状态外置做工具,等于音乐界开始给模型接 DAW。殊途同归。
一个我个人比较在意的拐点是”多智能体协作”开始走出论文。浙大 + 腾讯优图的 AdaMARP(ACL 2026)给角色扮演加上了环境通道和场景调度,让 AI 不只会说话,还会”想”、会”动”、会”感知环境”;浙大高云君、毛玉仁团队的 OpenStory 已经在 GitHub 开源,把《红楼梦》做成了一个多智能体演化沙盒,扔进孙悟空会触发整本结局的蝴蝶效应;微软亚研院的 DuoDrama 拿了 CHI 2026,让编剧用一个 AI 同时跑”角色体验”和”角色评估”两个视角去反思剧本。这些工作的共同点,是AI 正在从”打字机”升级成”编辑/导演”——一个负责提案,一个负责审,一个负责改。
04接下来 12-24 个月会看到什么
基于上面这些事实和工程代价的判断,几条比较硬的趋势:
- 创作工具从”输入框”变成”工作台”。提示词对话框会越来越边缘,状态台账、版本管理、引用追溯、协作审稿这些原本属于写作团队/音乐制作团队的能力会被打包进 AI 产品。商业模型也会从”按 token 收”挪到”按席位/按项目/按产出收”。
- 检测和标注的军备竞赛会升级。平台侧的检测只会越来越准、维度越来越多;读者侧会出现”human-first premium”——愿意为人工创作支付溢价的细分市场已经在形成。一边是技术防御,一边是市场筛选,两条线同时收紧中间地带。
- 训练数据授权变成护城河。Suno-Warner、Udio-UMG 的条款会被全行业复刻,授权数据集是未来一两年模型迭代最稀缺的资源。“我们训练了哪些书""我们能不能公开数据来源”会比”我们多 5% 准确率”更值钱。
- 多智能体协作会下放成标配。论文阶段的成果一年内会以”策划-写作-审校”、“作曲-编曲-混音”、“编剧-导演-剪辑”这类工作流产品的形态进市场。最先被压缩的,是单点提示词套壳应用。
- 中间层塌陷。纯靠包装 GPT 接口的”AI 写作工具""AI 作曲工具”在 2027 年前会死掉一批,留下来的要么是带状态层的、要么是带领域工作流的、要么是带授权数据的。剩下的中间地带不存在。
05给创作者和开发者的实操建议
如果你是写作者(无论长篇、短篇、网文、严肃文学),三句话:让工具管事实连续性,自己管意义连续性;用不同的模型审计自己的稿,模型对自己的机器指纹有系统性盲区;长短句故意交错,把每章 15-20 字的均匀句式砸碎,是目前最廉价也最有效的”去机器感”手段。
如果你是开发者或创业者,三句话:做状态层、做验收层、做可追溯,别做第 101 个提示词盒子;把”我训练了哪些书/哪些歌”当成产品页里最值钱的一段;模型折旧和授权变更的速度,会比大多数产品迭代更快,工具的可替换性是产品设计的一等约束。
如果你是普通读者:欢迎来到一个”分不清作者是谁”的市场。一种理性的应对是把”作者是谁”和”这本书值不值得读”解耦——绝大多数时候你买的是这一本书的体验,不是作者的人生;少数时候你想为某个人的视角付费,那就去他的作品页、播客、社交账号,作品之外的人格本身就是一种不可被模型模仿的护城河。
我越来越相信的一件事是:AI 让”生成”变得便宜的同时,也让”对作品负责”变得更贵。一段旋律、一章小说,从输入框里出来只要几秒;但愿不愿意为它署名、愿不愿意改到第十五版、愿不愿意承担它被读者骂的所有后果,仍然是人的事。这件事不会随着模型升级而消失,反而会越来越变成创作者和开发者真正比拼的东西。
06信息来源
Stony Brook 大学 arXiv 工作论文(2026-07-22);《纽约时报》2026 年初 86,000 人 AI vs 人类写作盲测;Mark Lawrence 964 票盲测;雨果奖得主郝景芳 2026 年 6 月访谈;Jenova AI《Why Do AI-Written Novels Suffer from Character Drift and Continuity Errors》关于注意力架构与 Elkins 研究的综述;Noveling、Sudowrite、Novelcrafter 官方文档;SCORE 论文(arXiv);番茄小说 2026 年 5 月/6 月/7 月低质内容治理公告;起点中文网《关于进一步加强对非真人自动化创作管理力度的公告》(2026-04);《网络文学行业反洗稿自律公约》(2026-04,16 家平台联合签署);Suno Blog v5.5 公告、BestAIWeb《Suno v5.5, Mureka V8, and the Post-Settlement AI Music Market》、Toolso.AI 2026 AI 音乐对比;昆仑万维 2026 年半年度报告、《中国证券报》2026-08-20 报道、Mureka V9/V9.5/O3 官方发布资料;浙大 OpenStory(GitHub:ZJU-LLMs/OpenStory)、AdaMARP(ACL 2026)、微软亚研院 DuoDrama(CHI 2026)等学术与开源资料。本文观点部分为作者个人分析,不构成投资或创作建议。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。