我写了一本AI教材:AI多久能写得更好?
长篇非虚构写作,仍是模型的短板
围绕AI写作的批评,常常集中于创意写作:缺少鲜明声音、独特观点和人类表达中可被感知的思考过程。但在非虚构与解释性写作领域,问题同样值得重视。
语言模型早期就展现出生成文案、补全文本的实用价值。按理说,随着模型能力快速提升,技术说明、知识普及和教材类文本应当成为更容易被自动化的领域。然而,经过数年将模型作为写作助手的实践,作者认为,模型虽有进步,却尚未在长篇非虚构写作上实现预期中的跃升。
这也对“模型将在近期自主解决重大开放性科学问题”的判断提出了一个基础性疑问:如果模型还难以组织并清晰、有说服力地呈现成熟领域的既有知识,那么它距离独立处理宽泛、开放的科学问题或许仍有距离。
知识组织不仅是复述,更是一种压缩
作者提出,组织知识本身就是一种压缩,而压缩是形成洞见的必要环节。
当前模型在长篇非虚构写作中,往往会增加而非降低信息熵:单句可能正确,局部段落也能成立,但一旦延展到完整章节,常会出现措辞令人困惑、结构混乱、概念细节失准等问题。模型会在不必要的地方追求花哨表达,并由此引入随机性的概念错误。
这种局部正确、整体失衡的现象,意味着模型尚不擅长在持续增补内容时反复审视已有部分,再将各组件编织为一致的整体。问题看似是误差不断累积,且难以仅靠延长输出或增加推理预算来消除。
作者认为,写作能力与编程、数学、检索和研究等能力的进步轨迹并不一致。模型在后几类任务上的提升很快,但高质量写作可能需要不同类型的训练数据、反馈机制和评估环境。
模型擅长局部检查,不等于擅长完成一本书
在教材写作过程中,作者使用模型处理了多种工作,包括:
- 协助处理公式的 LaTeX 排版;
- 进行大量文字校对;
- 为 TikZ、Python 等工具生成图示代码;
- 在 Markdown 与 LaTeX 的不同版本之间同步修改;
- 定位编辑提出的问题,并区分简单笔误与需要深入处理的内容。
模型在逐句、逐个公式或逐张图检查时表现突出。例如,作者曾将一份接近定稿、约200至300页的书稿PDF交给 GPT 5.5 Pro,模型找出了不少细微且出人意料的错误。
在编辑工作中,Claude 系列模型则被认为更有帮助:它们对任务的心智模型把握更好,建议更有判断力,也更能帮助作者突破不同类型的写作阻塞。
但这些优势大多发生在局部层面。模型能够检查一个内容单元,或帮助处理一个具体卡点;当任务变成协调大量组成部分、维持全书一致的叙述与逻辑时,效果就明显下降。
AI适合作为工具,而不是替代作者的判断
作者透露,书中确实有极少量技术解释句子吸收了模型的建议,占比远低于1%。这些内容之所以被保留,是因为作者作为领域专家确认它们确实符合读者需要。
在编辑流程中,作者会让模型定位文稿中的编辑批注、展示上下文,并初步判断问题属于简单修改还是需要更细致的处理。最终由作者撰写回复或决定采用何种修改;有时,模型建议中的个别措辞会进入成稿。
这种协作方式的关键在于:人仍然负责理解、判断和把关。对于不具备足够领域知识的写作者而言,模型生成内容中的错误可能更难被发现。
作者也将类似原则用于科研写作。AI适合处理重复性内容,例如自己早已熟悉的背景材料或相关工作草稿;但摘要、引言、实验和结论等部分承载着研究叙事与核心判断,若过度交给模型,可能削弱研究者对问题本身的理解。
效率提升,不会自动带来理解加速
在实际出版工作中,AI代理显著减少了重复劳动。例如,为了同时维护供读者反馈的网页版本和供编辑团队审阅的另一份版本,作者需要在 Markdown 与 LaTeX 文稿间同步修改。作者估计,若没有AI代理,这项工作耗时可能会增加到原来的五倍,而即便使用了工具,任务本身也已花费数十小时。
不过,效率的提升并不意味着理解速度同步提升。直觉、品味、判断力和本能,仍需通过人自身的学习与写作过程积累。若将非虚构写作中过多内容交给AI代劳,写作者也可能失去形成这些能力的机会。
作者的结论并非否定AI在科学与写作中的价值。模型已经是科学家可用的强大助手之一,尤其适合处理公式、代码、版本同步和重复性任务。但在长篇技术写作的结构组织、整体连贯性与真正的洞见生成方面,人类专家目前仍是不可替代的引导者与最终责任人。
