一篇论文变成一张学术会议海报,需要多久?

人工做,大概半天到一天。Claude Design(Anthropic的商用设计系统)需要几分钟。美团和北大联合提出的AutoDesign,40分钟,花费不到3美元,253次工具调用,11轮编辑——做出来的人类盲评偏好度最高。

更关键的是:在PosterBench评测中,AutoDesign拿到78.32分,比Claude Design高7.45分。

一个学术系统赢了Anthropic的商用产品。原因不是模型更强,而是它学会了一件事:改进做海报的流程本身,而不只是改进某一张海报。

设计系统只会改作品,不会改自己

现有的AI设计系统工作模式很简单:生成一张海报→收到反馈→修改这张海报→再收反馈→再改。

问题在于,每次做新海报时,系统都是从零开始。上次做海报时学到的经验——比如"公式应该放在方法部分右上角"、"图表配色不要超过四种"——没有被记录下来。每次都是现学现忘。

人类设计师不是这样的。做过10张海报的人,第11张会比第1张快很多。他积累的不是具体的设计稿,而是设计判断——什么场景用什么布局、什么信息密度合适、什么配色能过审。

AutoDesign想做的事情是:让AI系统也能积累设计判断。

双层循环:改作品和改流程

AutoDesign的结构是一个双层循环。

内层循环是设计harness(DesignHarness):拿到一篇论文,提取关键信息,生成可编辑的HTML海报,用规则验证器和视觉评审打分,然后局部修改。这个循环只做一张海报。

外层循环是meta-harness优化器:拿同一套harness做很多张海报,收集所有执行轨迹和评分,找到反复出现的失败模式,然后让一个编程Agent去修改harness的源代码。

关键设计是"有界更新":每次只改harness五个功能组件中的一个(上下文记忆、工具规范、执行运行时、编排逻辑、评审反馈)。改完之后,在训练集和开发集上分别验证——如果训练集分数提升且开发集分数没降,接受修改;否则回滚。

这个接收门控防止了过拟合。7天的自动优化过程中,系统记录了至少123次递归迭代,积累了54次harness更新。

*图:AutoDesign从初始harness(49分)自动优化到80.88分的平台期,人工引导后进一步达到88.39分。来源:arXiv:2608.13560*

所有编程Agent都变强了

AutoDesign最有趣的实验结果不是自己的分数,而是DesignHarness对其他系统的影响。

研究者把优化后的DesignHarness套到7个不同的编程Agent上——从GPT-5.5 + Codex到DeepSeek V4 Pro + Claude Code。结果:每个Agent都变强了,提升幅度从5.0分到19.6分不等。

| 编程Agent | 原始分 | 加上DesignHarness | 提升 |

|-----------|:---:|:---:|:---:|

| GPT-5.5 + Codex | 75.9 | 81.5 | +5.6 |

| Claude 4.8 + Claude Code | 69.5 | 74.6 | +5.0 |

| Seed 2.1 Pro + Claude Code | 54.0 | 71.8 | +17.8 |

| DeepSeek V4 Pro + Claude Code | 34.7 | 54.3 | +19.6 |

*数据来源:arXiv:2608.13560 Figure 1(b),美团/北大,2026年8月*

这说明DesignHarness确实学到了模型无关的设计知识。弱的Agent提升更大(DeepSeek V4 Pro从34.7到54.3,涨了56%),因为harness弥补了模型能力的不足。强的Agent提升较小,因为模型本身已经能做大部分判断。

在人类盲评中,11位评审给出了933个有效判断。AutoDesign在成对比较中的胜率是64%——当两个系统的PosterBench分差超过20分时,评审选择高分系统的概率是74.4%。

改流程比改模型管用

AutoDesign的核心洞察用一句话概括:优化系统比优化模型更划算

模型参数是固定的。不管你怎么调prompt、换工具、改布局,底层模型没变。但harness——就是模型周围那一圈上下文管理、工具调用、评审反馈、执行逻辑——是可以改的。

这个逻辑和Agent领域的Harness概念完全吻合。8月13日DeepSeek开源DSH(DeepSeek Harness)之后,"Harness"这个词从工程语境走进了大众讨论。Harness不是模型的wrapper,而是Agent的行为系统——它决定了模型怎么用工具、怎么管理上下文、怎么判断什么时候停下来。

AutoDesign证明了:让AI自己改自己的Harness,比人工写Harness更有效。

源势AI观点

AutoDesign的意义超出了"论文变海报"这个具体场景。它展示了一种模式:AI系统通过元优化(meta-optimization)来积累流程知识,而不只是积累作品。

这对所有需要"持续生产同类但不同具体内容"的场景都有启发——日报生成、代码审查、报告撰写、PPT制作。这些任务的共性是:流程稳定但内容变化。一个好的harness应该能从上一次执行中学到流程改进,而不是每次重新摸索。

当前的限制是PosterBench只验证了海报场景。但框架本身——双层循环、有界更新、接收门控——可以直接迁移到其他设计任务。美团选择海报作为切入点,可能因为海报的评审标准相对明确(七个维度都有算法或模型可以打分),这为meta-optimization提供了可靠的信号源。

---

来源标注

1. 美团/MBZUAI/北大等, "AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design", arXiv:2608.13560, 2026年8月13日

2. PosterBench评测协议,100篇论文跨五个学科

3. DeepSeek Harness (DSH) 开源项目,2026年8月13日