data_sync_retry
data_sync_retry:设置数据文件同步失败后是否继续运行。实测在档范围为 PG9.4–19 Beta 3;最后在档的 PG19 Beta 3 启动默认值为 off,context 为 postmaster。这是测试版快照事实,PostgreSQL 19 正式发布前仍可能变化。
说明
Fact — 官方简述译文:设置数据文件同步失败后是否继续运行。
身份
生命周期
| Fact | 值 |
|---|---|
| 首次观测 | PG9.4 |
| 在档版本 | PG9.4–19 Beta 3 |
| 移除版本 | 否 |
| 引入提交 | f1ff5f51d249 — PANIC on fsync() failure. |
| 提交日期 | 2018-11-19 |
| Discussion | 讨论 1 |
默认值变迁
| 版本 | 原始 boot_val |
单位 | 人类可读值 |
|---|---|---|---|
| PG9.4–19 Beta 3 | off |
— | off |
机制详解
设置数据文件同步失败后是否继续运行。该值在服务器启动时固定,修改后必须重启。
数据文件 fsync 失败后,默认认为 shared buffers 可能已经不一致并触发 PANIC,让崩溃恢复重建状态。继续运行可能丢失对脏页的认知,只适合内核同步语义能保证安全重试的特定平台。
应把 data_sync_retry 与 restart_after_crash、recovery_init_sync_method、fsync 一起监控和变更。先在对应角色与真实负载上验证,再按其 postmaster context 选择会话修改、reload 或 restart;历史默认值并不等于当前有效值。
调优建议
提示
Advice。 以下建议是工作负载起点,必须用真实测量验证。
| 场景 | 建议 |
|---|---|
| OLTP | 根据故障模型与实际观测决定是否修改 data_sync_retry;先做会话/测试环境验证,再按 context 安全部署并保留回滚值。 |
| OLAP | 在长查询、批任务和峰值并发下单独验证,避免把 OLTP 经验直接套用到分析节点。 |
| 小规格 | 没有明确问题就保持默认;小规格环境更应避免以全局兼容性或故障策略换取微小收益。 |
Pigsty 取值
以下值来自固定 8 核、32 GiB、100 GiB SSD 夹具,并按 PG19 Beta 3 渲染当前 Pigsty 模板;这不表示 Pigsty 当前支持该历史或测试版本。
| 模板 | 有效值 | 与上游 boot 比较 | 源表达式 |
|---|---|---|---|
| OLTP | 未修改 | — | — |
| OLAP | 未修改 | — | — |
| CRIT | 未修改 | — | — |
| TINY | 未修改 | — | — |
注意
Advice — 待人工复核。 当前 Pigsty 模板投影事实:OLTP: PG9.4–19 Beta 3 未修改;OLAP: PG9.4–19 Beta 3 未修改;CRIT: PG9.4–19 Beta 3 未修改;TINY: PG9.4–19 Beta 3 未修改。 未发现覆盖值,因此不推断 Pigsty 专属理由。
常见坑
- 在 fsync 失败会丢失脏页认知的平台上开启。
- 不隔离坏存储就把 I/O 错误当成暂时故障。
- 为表面可用性牺牲数据正确性。
- 把 data_sync_retry 的启动默认值误当成当前有效值。
- 忽略 postmaster context 对生效时机的约束。
关联参数
restart_after_crash · recovery_init_sync_method · fsync · full_page_writes · exit_on_error