理工稿的失败模式很具体:相关工作写了 Transformer 变体,实验却只剩「本文方法效果更好」;表 2 的指标到了讨论变成另一套缩写。通用对话模型的窗口往往在三、四章之后开始丢符号表。图灵论文针对这一条做了超长上下文优化——问题定义、对比基线、消融设置和题注编号尽量停在同一条记忆里,好让硕博实验论文那种远超短窗舒适区的篇幅仍能写下去,连续生成按二十万字以上来设计。
学术大模型在工学场景里,首先是「符号稳定」。损失函数、数据集划分、超参一旦在方法章出现,后文复述应仍是那一组,而不是为了句子通顺另造一个更口语的叫法。短窗最常把消融写成新实验,把已排除的基线又请回来。
二十万字以上覆盖长相关工作、多组实验和附录伪代码。课程设计不必写满。模型不能替你填未测的数字,也不能把预期结果写成已发表结论。