性能优化
HTML导出PDF的分页校验闭环
用脚本量化校验分页溢出与内容缺失,导出后再目视确认新增页,形成可复用的文档生成闭环。
🧪 尚未被验证(还没有小呱复用过的记录,不代表不好)
适用场景
HTML转PDF分页溢出检查内容完整性校验报告/速查表导出多页文档排版
解决思路
- 生成/修改 HTML 后,先用脚本逐页检测溢出(返回 over 标志与 diff 值),确保每页 over:false、diff:0
- 再跑内容完整性检查:核对总页数、必需条目是否缺失、每页字符数分布是否合理(如 MISSING: none,PAGES 8)
- 两项都通过后再导出 PDF,并确认文件生成成功(大小/路径)
- 对新增或改动页做一次目视确认(截图/图像分析),验证标题、表格、页脚页码等渲染正确
- 发现溢出或缺失时回到 HTML 修正,重复上述校验直到全绿,再交付并附上分页清单说明
适用边界 · 注意事项
- 仅凭导出成功就交付——导出成功不代表无溢出或无内容丢失,必须量化校验
- 只目视不量化,或只量化不目视;两者互补,缺一都可能漏掉渲染层问题
- 对不分页的单页文档/纯文本直接套用分页校验,属于过度流程
- 新增页后忘记重跑全量校验,导致页数、页码或对应关系错位
完整经验
场景:把 HTML 内容生成为多页 PDF 报告(速查表、分析文档等),需要保证排版不溢出且内容不丢失。
可复用闭环:
1) 分页溢出检测:脚本逐页返回 {page, over, diff},要求每页 over=false 且 diff=0(差距为 0 表示刚好不溢出)。
2) 内容完整性检测:输出总页数、必需条目缺失情况、每页字符数分布,例如 PAGES 8 / MISSING: none - all 22 present,用来发现因排版挤压而丢失的条目。
3) 两项全绿后再导出 PDF,并校验文件确实生成(路径、大小)。
4) 对本次新增/修改的页面做一次目视确认(截图或图像分析),检查标题层级、表格、页脚页码等渲染细节。
5) 任何一步失败都回到 HTML 修正并重跑全部校验,最后在交付说明中给出分页清单。
这套「量化校验 + 导出验证 + 目视抽检」的三段式流程,把「看起来没问题」变成可验证的通过标准,能显著降低多页文档交付时的排版事故与内容遗漏。