Bricks Planet
返回砖块库

Brick Card

Durable execution

可以先理解为:工作流失败后能从持久状态恢复执行的模式

Durable execution 像游戏存档:中途崩了,不用从第一关重来。对 agent 长任务来说,关键不是把聊天记录留住,而是把工作流状态、步骤结果和恢复点可靠保存。

关键结构图

Workflow runtime记录步骤
Workflow state原子提交
事务边界失败重试
恢复点从恢复点继续
validation gates
回到下一轮

中心写 Durable execution,左侧是 Workflow runtime 和 Workflow state,下方是事务边界与幂等步骤,右侧连接 Resumable run 和 validation gates,用回环箭头表示失败后从恢复点继续。

What

Durable execution 像游戏存档:中途崩了,不用从第一关重来。对 agent 长任务来说,它依赖持久状态、事务边界、幂等步骤和可恢复检查点。

Durable execution 是让长工作流在失败、暂停或中断后能从持久状态恢复的方法。它持久化的不是一句聊天记忆,而是步骤、状态、结果、恢复点和事务边界。数据库事务、队列、幂等操作和工作流 runtime 都可能参与其中;重点是失败后能知道做到哪、哪些结果已经提交、下一步该从哪里继续。

When

当一个 agent 任务需要跑很久、会调用多个工具、可能被暂停或失败后重试时,可以用 Durable execution 检查它是否真的可恢复。

How

先定义哪些步骤必须原子提交,哪些步骤可以重试,哪些结果要写入 workflow state,哪些失败需要人工介入。再检查 runtime 是否能从最后一个可信恢复点继续,而不是从头再跑或重复提交副作用。

Examples

一个 agent 要批量整理文件、调用外部 API、生成报告并发起发布。如果中途网络失败,Durable execution 应该让它知道哪些文件已处理、哪些 API 调用已成功、报告是否已经进入下一步。

一个工作流 runtime 使用数据库事务保存步骤状态时,事务不是目的本身;它只是帮助系统避免一半提交、一半丢失的状态。

来源

类型:系统结构 / 概念整理

事实线:这张卡把「Durable execution」整理为 agent 长任务和后台工作流中的可恢复执行方法。

依据:来自 1000 Bricks 既有工作流运行时概念,并合并 2026-07-06 AI 内参中关于 Postgres 事务与 durable workflow 的公开材料信号。

边界:适用于理解 agent 长任务、后台自动化、工作流 runtime 和失败恢复;不等于 Postgres 是唯一实现方式,也不等于有数据库事务就自动拥有可靠工作流。

常见误读:不要把 durable execution 当成保存聊天历史。它要保存的是可恢复的工作状态和已经提交的事实。