引言
AI演示工具擅长生成初稿,但真正的难点在于后续工作。
用户可能会要求减少文字、增加图表、调整视觉节奏,或修改某张幻灯片上的一个小元素。在许多系统中,每次新指令都可能覆盖之前的偏好设置,或破坏原本正确的内容。
MemSlides将演示文稿创作视为一个持续、有状态的撰写过程,而非一次点击的转换任务。该框架由北京邮电大学、清华大学和上海交通大学的研究人员共同开发,将分层记忆与精准的幻灯片编辑相结合。
该系统的设计目标是:跨项目记住稳定的偏好设置,在当前演示文稿中保留临时指令,复用成功的编辑策略,以及仅修改用户实际要求修改的区域。
MemSlides论文在Hugging Face每日论文中位居榜首,同时该项目还发布了开源代码库、项目页面和在线演示。

MemSlides:仅生成幻灯片还不够
演示文稿工作很少能一次完成。
研究型演示在导师反馈后可能需要多轮修改。商业路演文稿的故事线、数据重点、视觉层次以及最终的行动号召都可能经历反复调整。用户往往是在看到初版之后,才能明确自己的偏好。
这给AI幻灯片智能体带来了三项实际要求:
- 必须记住在不同演示任务中保持稳定的偏好设置。
- 必须保留仅适用于当前演示文稿的临时规则。
- 必须理解局部编辑的边界,避免重写无关内容。
MemSlides并非通过将整个对话历史塞进一条越来越长的提示词来解决这个问题,而是按照记忆的生命周期和功能进行分离。

层级记忆设计
MemSlides采用两种记忆生命周期:
- 长期记忆在多个演示任务间持续存在。
- 工作记忆在当前演讲稿及其修订轮次中保持活跃。
长期记忆再按功能划分:
- 用户画像记忆记录反复出现的用户偏好。
- 工具记忆存储可复用的编辑与执行经验。
由此形成一个分层系统,智能体既能区分永久偏好与临时需求,同时让演示风格与操作编辑知识相互分离。
| 记忆组件 | 生命周期 | 主要用途 | 示例 |
|---|---|---|---|
| 用户画像记忆 | 跨项目 | 存储稳定、意图感知的偏好 | 偏好低文本密度和可视化解释 |
| 工作记忆 | 当前演讲稿 | 保持临时规则和活跃修订状态 | 本演讲稿中的新幻灯片应使用蓝色标题 |
| 工具记忆 | 跨相似编辑 | 复用成功的编辑流程 | 更改图表而不影响布局的可靠步骤 |

在新任务期间,MemSlides利用源材料、可选模板及相关画像记忆创建首份演讲稿。收到新反馈时,系统更新当前会话状态并执行局部修订,而非自动重新生成整个演示文稿。
用户画像记忆:学习稳定的演示偏好
个性化往往被简化为基本角色描述,例如“学术研究员”、“金融分析师”或“创业创始人”。这些信息虽有价值,但无法全面描述个人的沟通偏好。
两位研究员对演示文稿的需求可能大相径庭。一人可能偏好每张幻灯片一个结论、最少公式,另一人则可能要求详细推导、实验条件及大量支撑证据。
MemSlides组织用户
围绕演示意图和几个偏好维度构建用户画像记忆:
- 主题
- 内容
- 视觉风格
- 布局
- 模板使用
- 一般演示习惯
当启动新任务时,智能体会检索与当前意图匹配的用户画像条目,然后将其与用户最新请求及任务特定模板进行协调。

偏好如何进入初稿
用户画像记忆会影响初始(即第零轮)演示的生成。
智能体不会机械地将论文或文档拆分为固定数量的幻灯片,而是利用活跃画像来决定:
- 哪些概念需要提前定义
- 每张幻灯片应呈现多少证据
- 机制是否需要图表说明
- 可接受多少文字量
- 结论是否应在细节之前出现
- 最后一张幻灯片是否应包含行动要点或清单
这使得个性化不仅体现在颜色或字体的更改上,更深入内容策划与布局层面。
稳定偏好如何固化
并非每项指令都应成为永久偏好。
例如,用户可能因匹配客户品牌色而为一组演示请求蓝色标题,但 MemSlides 不应据此认定用户始终偏好蓝色标题。
任务结束时,系统仅整合那些被认为稳定且可复用的交互信号。临时选择保留在当前任务中,而非自动写入长期画像。
这种区分有助于避免两种常见问题:
- 要求用户为每个项目重复说明基本偏好
- 将一次性指令视为永久个人习惯
工作记忆:保持临时指令活跃
某些指令在一组演示中至关重要,但任务完成后应自动失效。
考虑这样的请求:
“如果后续添加新幻灯片,其标题也应为蓝色。”
在当前编辑轮次中若未添加幻灯片,该指令可能暂不相关。无状态智能体容易遗忘此类指令。MemSlides 将其存储在工作记忆中,使其保持活跃状态,直至后续轮次触发新建幻灯片操作。

工作记忆会追踪以下信息:
- 临场的呈现偏好
- 会话特定的约束条件
- 当前的呈现目标
- 先前编辑过的区域
- 未完成的检查项
- 修改历史与活跃状态
这能将一系列孤立的提示词转化为对同一演示文稿的连续编辑。
当某个指令需要覆盖长期偏好时,工作记忆也很有用。对于当前任务,明确的用户反馈具有更高优先级。因此,系统可以应用临时例外,而无需重写用户的持久配置文件。
工具记忆:复用可靠的编辑经验
理解请求并不能保证代理能安全地执行它。
一次小小的幻灯片编辑可能涉及:选中正确元素、修改正确属性、保持对齐、更新底层表示、渲染结果,并验证其他部分未发生变动。
代理可能会因以下原因失败:
- 选错区域
- 改错代码或对象
- 执行的编辑范围超出了请求范围
- 在更改完成前停止
- 重复执行之前失败的步骤序列
工具记忆专注于这一执行层面。
MemSlides 记录两种经验:
- 轮次级任务经验,它总结了一次编辑轮次中的教训、错误和有用模式。
- 操作级工具链经验,它存储了推理、工具调用和观察的紧凑序列,以便在类似操作中复用。

结果表明,使用工具记忆时,闭环完成率更高,严格验证率更强,首次正确编辑的平均时间显著缩短。
这些数据来自一个控制诊断环境,涉及九组匹配的修改对。不应将其解读为 MemSlides 在所有演示任务中均优于其他方案。该研究更聚焦于:测试在匹配条件下,可复用的工具经验是否能提升局部编辑效果。
本地运行 MemSlides
该项目采用 Apache 2.0 许可证开源。官方仓库提供了源码安装和 Docker 工作流两种方式。
从源码安装
sudo apt-get update
sudo apt-get install -y libreoffice fontconfig fonts-noto-cjk poppler-utils
conda env create -f environment.yml
conda activate memslides
pip install -e ".[research]"
python -m playwright install chromium ffmpeg
python -m memslides.experiment --help
运行内置烟雾测试套件:
python -m memslides.experiment run smoke_minimal \
--output-base .memslides/experiments \
--parallel 1
使用 Docker 运行
docker compose build
docker compose run --rm memslides python -m memslides.experiment run smoke_minimal \
--output-base /app/.cache/memslides/experiments \
--parallel 1
smoke_minimal 套件旨在作为小型验证运行。实际生成实验需要用户提供模型和服务凭证。
请将凭证置于仓库之外。项目支持环境变量、.env 文件,以及通过 MEMSLIDES_CONFIG_FILE 或 --config 指定的私有 YAML 配置。
为什么 MemSlides 的设计意义超越 PPT 生成
许多长期运行的智能体工作流都存在同样的记忆问题。
文档智能体需要保留写作偏好,但不能将每次编辑视为永久更改。编码智能体需要记住项目规范,同时将临时分支的特定指令分开存储。数据分析智能体需要在复用可靠工具流程的同时,保持当前目标。
MemSlides 展示了更广泛的设计原则:
- 持久性用户偏好应与会话状态分离。
- 会话状态应能在多轮交互中存活。
- 执行经验应独立于用户偏好存储。
- 本地请求应在明确边界内运行。
- 在修订被视为完成前,应进行验证。
因此,该框架的价值不仅限于制作精美的幻灯片。它提供了一个具体示例,展示了智能体如何从一次性生成转向可靠的迭代式协作。
常见问题
什么是 MemSlides?
MemSlides 是一个记忆驱动的演示智能体,用于个性化幻灯片生成和多轮局部修订。它结合了用户画像记忆、工作记忆、工具记忆以及限定范围的编辑工作流。
MemSlides 是 AI 版 PowerPoint 生成器吗?
是,但其核心重点不仅是生成初稿。
旨在记住用户偏好、在多次修订轮次中延续指令,并修改有限的幻灯片区域,而无需不必要地重建整个演示文稿。
用户画像记忆存储什么内容?
用户画像记忆会根据演示意图以及主题、内容、视觉风格、布局、模板使用和通用习惯等维度来存储重复出现的偏好设置。只有相关的画像项目会被导入新的任务中。
工作记忆与长期记忆有何区别?
长期记忆会跨演示项目持续存在,包含稳定的用户偏好和可复用的工具使用经验。工作记忆则归属于当前演示文稿,记录临时指令、活动约束条件和修订状态。
MemSlides 如何避免修改无关的幻灯片内容?
它采用限定范围的幻灯片局部修订机制。系统会识别出影响最小的区域,执行最小幅度的编辑,并在完成该轮修订前验证覆盖范围。
MemSlides 能否通过 Docker 运行?
可以。官方仓库包含 Docker Compose 文件,以及用于在容器内运行内置冒烟测试套件的命令。
MemSlides 需要 API 密钥吗?
实际生成实验需要用户选择的模型和服务的凭据。仓库建议将凭据存储在环境变量、.env 文件或私有配置文件中,而不是提交到 Git。
MemSlides 是开源的吗?
是的。其源代码在 GitHub 上以 Apache 2.0 许可证提供。作者还提供了项目页面、论文、在线演示以及 Hugging Face 论文页面。
相关工具
- MemSlides 演示:用于试用个性化幻灯片生成工作流程的官方在线工作空间。
- MemSlides GitHub:开源实现、配置文件、实验运行器和 Docker 配置。
- MemSlides 项目页面:框架、记忆组件、示例及成果的概览。
- Docker:在可复现的容器环境中运行项目及其依赖项。
- LibreOffice:用于打开和转换 PPTX 文件,本地流程必需。
- Playwright:提供项目设置和渲染工作流所使用的浏览器自动化功能。
相关链接
- MemSlides 论文 (arXiv):描述框架和实验的官方研究论文。
- MemSlides HTML 版论文:整篇论文的浏览器可阅读版本。
- MemSlides 在 Hugging Face 上:论文页面、社区讨论和项目链接。
- MemSlides GitHub 仓库:源代码、安装命令、Docker 文件和实验工具。
- MemSlides 项目网站:关于画像记忆、工作记忆和局部修订的可视化解释。
- [MemSlides 在线演示]
com/): 用于测试系统的官方网页界面。
- Apache License 2.0: 开源仓库使用的许可证。
总结
MemSlides 将幻灯片创作视为一个持续的编辑过程,而非一次性生成请求。其分层记忆机制能够稳定保留用户偏好、临时幻灯片级指令以及可复用的编辑经验。
范围限定的修订流程会将每次修改限制在最小必要范围内,并在完成一轮编辑前验证结果。在论文的诊断性配对实验中,工具记忆功能在提升完成度与验证准确性的同时,还缩短了达成正确编辑所需的时间。
核心思路很简单:一个实用的演示工具必须记住正确的信息,在适当时机遗忘临时细节,并且只修改用户实际要求修改的内容。



