同じ Word 文書が、自分の PC では 5 ページ、同僚に送ると 6 ページ、PDF にするとまた違い、Web ページにすると分割がもう一度変わる。つい「ファイルが壊れた」「ツールが悪い」と思うが、実際はページ分割をファイルに保存された固定値だと思い込んでいるだけだ。そうではない。
Word のページ分割は保存されているのではなく、算出される。ファイルが持つのは内容と規則——文字、スタイル、段落、「この文は何のフォントで何ポイント、行間いくつ」だ。その内容がどう流し込まれて何ページになり、どこで改ページするかは、開いたプログラムがその場で組版して算出する。算出は三つに依存する。フォントメトリクス(同じフォント名でもシステムによって字形幅が微妙に違う)、プリンタメトリクス(Word は既定プリンタのページ設定を参照して印刷結果に合わせる歴史がある)、互換モード(どの Word バージョンの組版規則で動くか)。どれか一つ変われば同じ内容でもページ数が変わる。
肝心なのは、OOXML は「最終的な改ページがどこか」を確実には保存しないことだ。保存されるのは分割を生む材料(内容+規則)で、分割そのものではない。改ページのヒントを持つ文書もあれば、持たない文書もある。だから変換ツールが docx を受け取ったときの現実はこうだ——内容と規則は手元にあるが、「元の作者のマシンでどの行で切れたか」はファイルに書かれていないかもしれない。
これがツールの誠実さの限界を決める。ImgIng の docx→html は座標で固定レイアウトを再構築するが、ページ分割については信頼できる改ページ標識がないとき、ページ末尾の確認を促す——それらしく見えて実は間違っているかもしれない分割をハードコードしない。この判断に賛成だ。もう一方(自分の算出した分割を正解として押し通す)は、不確実な推測を事実として渡すことだ。文書変換では「確信がない」と示すほうが、綺麗だが間違ったページ番号を出すよりずっと役に立つ。
だから「出力があなたの Word と同じページ分割になる」とは約束しない。これは能力不足ではなく、この問題自体に唯一の正解がないからだ。あなたの Word のページ分割は「あなたのマシン・フォント・互換モード」での一つの結果にすぎず、別の環境では再計算される。「どの環境でも分割が完全一致」を追うのは偽の目標だ。
文書処理に関わる人への実用的な結論。「ページ分割が特定マシンと完全一致しなければならない」ケース——第 N ページ第 M 条を参照する契約、レイアウトに法的意味があるもの——なら、あらゆる環境間変換(PDF 化、Web 化、別 PC で開く)がリスクで、原本を保持して手でページ末尾を確認すべきだ。単にデバイスを跨いで開けてレイアウトがほぼ保たれる閲覧版が欲しいだけなら、HTML 単一ファイルへの変換はむしろ Word を送るより安定する——毎回マシンで再計算せず、レイアウトを固定するからだ。使ったのは ImgIng(imging.ai)。
