checkpoint_timeout
Fact — 官方简述译文:设置两次自动 WAL 检查点之间的最长时间。
身份
生命周期
| Fact | 值 |
|---|---|
| 首次观测 | PG9.0(研究下界) |
| 在档版本 | PG9.0–19 Beta 3 |
| 移除版本 | 否 |
| 引入提交 | 不作断言:早于 PG9.0 研究边界 |
| 提交日期 | — |
| Discussion | — |
默认值变迁
| 版本 | 原始 boot_val |
单位 | 人类可读值 |
|---|---|---|---|
| PG9.0–19 Beta 3 | 300 |
s |
5 min |
机制详解
达到 checkpoint_timeout 后系统会考虑执行自动检查点,但 max_wal_size 可以更早触发。如果上次检查点后没有写入 WAL,PostgreSQL 可以跳过这次定时检查点,因此它是最长调度间隔,而不是固定周期工作的承诺。
较长间隔通常会减少检查点次数和全页写放大,但崩溃恢复时可能需要重放更多 WAL。较短间隔能收紧重放区间,却会增加脏页写回以及每次检查点后的全页镜像。
主库检查点记录也限制备库可执行重启点的位置。不要用本参数定义 WAL 归档的 RPO;低 WAL 负载下强制切换段应使用 archive_timeout。
调优建议
Advice。 以下建议是工作负载起点,必须用真实测量验证。
| 场景 | 建议 |
|---|---|
| OLTP | 与 max_wal_size 联合调优,并通过 checkpoint_completion_target 平摊检查点 I/O。只有在量化恢复要求、请求型与定时型检查点比例、写延迟和 WAL 量之后才延长间隔。 |
| OLAP | 批处理期间通常是 max_wal_size 先触发。如果容量型检查点占主导,应先增加 WAL 空间,同时保留能满足重启与恢复目标的超时值。 |
| 小规格 | 在恢复时间重要且存储有限的环境里,上游 5 分钟是合理起点。延长间隔必须有明确的磁盘余量和经过测试的崩溃恢复预算。 |
Pigsty 取值
以下值来自固定 8 核、32 GiB、100 GiB SSD 夹具,并按 PG19 Beta 3 渲染当前 Pigsty 模板;这不表示 Pigsty 当前支持该历史或测试版本。
| 模板 | 有效值 | 与上游 boot 比较 | 源表达式 |
|---|---|---|---|
| OLTP | 15min |
不同于 boot 值 | 15min |
| OLAP | 15min |
不同于 boot 值 | 15min |
| CRIT | 15min |
不同于 boot 值 | 15min |
| TINY | 15min |
不同于 boot 值 | 15min |
Advice — 待人工复核。 当前 Pigsty 模板投影事实:OLTP: PG9.0–19 Beta 3 = 15min (dcs);OLAP: PG9.0–19 Beta 3 = 15min (dcs);CRIT: PG9.0–19 Beta 3 = 15min (dcs);TINY: PG9.0–19 Beta 3 = 15min (dcs)。 建议(待人工复核)——发布前应结合当前 Pigsty 模板及其实际支持的 PostgreSQL 版本确认运维意图。
常见坑
- 认为空闲系统也必然严格按该间隔执行检查点。
- 忘记 max_wal_size 可能更早触发检查点。
- 用 checkpoint_timeout 代替 archive_timeout 限制归档延迟。
- 增大后没有计入更长的崩溃恢复重放区间。
- 设置过小导致全页写和检查点 I/O 占主导。
关联参数
max_wal_size · checkpoint_completion_target · checkpoint_warning · archive_timeout · full_page_writes · checkpoint_flush_after