0
2

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

【PowerShell】Word未インストールで、docxファイルの中身をテキストプレビューする

0
Posted at

はじめに

「共有サーバーやテスト環境にある .docx(Word)ファイルの中身をちょっと確認したい……」

そんなとき、以下のようなトラブルや制限に直面したことはないでしょうか?

  • 作業端末やサーバーに Microsoft Office(Word)が入っていない
  • OfficeがなくてもWordを操作するPowerShellスクリプト(COMオブジェクト操作)は見かけるが、裏でWordアプリ本体が必須だったり、プロセスが残り続けたりして不安定
  • わざわざ手元のローカルPCにダウンロードしてからWordで開くのが面倒

実は、近年のWord文書(.docx)の実態は 「XMLファイル群をZIP圧縮したもの(OpenXML規格)」 です。

今回は、この仕様を活かしてMicrosoft Officeを一切使わず、Windows標準のPowerShell 5.1だけでdocx内の文章をパースし、専用のGUI画面で快適にプレビューする手法をご紹介します。

動作確認環境

サードパーティ製ライブラリの導入や、Microsoft Officeのインストールは一切不要です。Windows標準の機能のみで完結します。

  • OS: Windows 11 (Home)
  • シェル: Windows PowerShell 5.1
  • 前提ソフト: なし(Microsoft Office / Word 不要)

このスクリプトの特徴・メリット

1. 完全「Office(Word)不要」

WordのCOMオブジェクト(Word.Application)を起動する手法とは異なり、Officeソフト本体を一切呼び出しません。そのため、Officeがライセンスされていない環境でも動作し、「WINWORD.EXEのプロセスがタスクマネージャーにゾンビとして残る」といったCOM特有のトラブルもゼロです。

2. .NET標準のZIP機能で超高速抽出

.docx を拡張子リネームなしで直接ZIPアーカイブとしてストリーム展開し、本文が格納されている word/document.xml だけをメモリ上でピンポイントに読み出します。巨大な文書でも一瞬でテキストを抽出できます。

3. XML名前空間+XPathによる正確な段落抽出

XMLパーサーを用いてOpenXMLの名前空間(w="http://schemas.openxmlformats.org/...")を定義した上で、段落タグ(<w:p>)単位でテキストを抽出します。余計なメタデータタグを巻き込まず、人間が読める本文テキストだけを綺麗に取り出します。

4. RichTextBoxによる快適なプレビュー画面

抽出した文章は、Windows Formsの RichTextBox を使った専用ウィンドウで表示します。

  • スクロールが軽快で長文にも耐えうる設計
  • 誤操作を防ぐ「読み取り専用(ReadOnly)」化
  • フォントを「メイリオ」に指定し、日本語の可読性を確保

5. 徹底したリソース解放(ファイルのロック防止)

try - finally 構文により、読み込み完了時や万が一のエラー時でもストリームやZIPハンドル(Dispose)を確実に解放します。プレビューを開いたままファイルがロックされて移動・削除できなくなる心配がありません。

処理の全体フロー

スクリプトを実行すると、バックグラウンドで以下の流れが実行されます。

  1. ファイル選択ダイアログの表示
    Windows標準のダイアログが立ち上がり、拡張子が .docx のファイルを選択します。
  2. ZIPアーカイブとしてストリームオープン
    .NETSystem.IO.Compression.FileSystem を利用し、選択したファイルを読み取り専用のZIPとして開きます。
  3. word/document.xml の抽出と解析
    ZIP内から本文テキストが格納されているXMLファイルを特定し、文字データとして一括読み込み後、XMLオブジェクトに変換します。
  4. XPathによる段落テキストの収集
    名前空間マネージャーを適用し、すべての段落タグ(<w:p>)から InnerText を取り出し、改行コードで結合します。
  5. GUIプレビューウィンドウの生成と表示
    画面中央にプレビュー用のフォームウィンドウを立ち上げ、メイリオフォントを適用した読み取り専用のテキストボックス内に文書全体をレンダリングします。
  6. リソースの安全な破棄
    ウィンドウ表示・終了後、開いていたストリームとZIPファイルを確実に破棄(解放)します。

使い方

  1. スクリプト(.ps1)を準備し、PowerShellから実行します。
#  ファイル選択ダイアログなどのGUI機能を使うために System.Windows.Forms アセンブリを読み込みます。
Add-Type -AssemblyName System.Windows.Forms

# ファイル選択ダイアログの表示
#  ファイルを開くためのダイアログオブジェクトを作成します。
$dialog = New-Object System.Windows.Forms.OpenFileDialog
#  ダイアログのタイトルバーに表示されるメッセージを設定します。
$dialog.Title = "docxファイルを選択してください"
#  選択可能なファイルをWord文書(.docx)のみに絞り込むフィルターを設定します。
$dialog.Filter = "Word文書 (*.docx)|*.docx"

#  ダイアログを表示し、ユーザーが「OK」ボタンを押したかどうかを判定します。
if ($dialog.ShowDialog() -eq [System.Windows.Forms.DialogResult]::OK) {
    #  選択されたファイルのパスを $docxPath に格納します。
    $docxPath = $dialog.FileName
#  キャンセルされた場合の処理に入ります。
} else {
    #  キャンセルされた旨の警告を表示します。
    Write-Warning "キャンセルされました。"
    #  スクリプトの実行を終了します。
    exit
#  ダイアログ判定のif-else文を終了します。
}

#  選択されたWordファイルが実際に存在するかどうかを判定します。
if (-not (Test-Path $docxPath)) {
    #  ファイルが存在しない旨のエラーメッセージを表示します。
    Write-Error "ファイルが見つかりません: $docxPath"
    #  スクリプトの実行を終了します。
    exit
#  存在確認のif文を終了します。
}

#  ZIPファイルを操作するため System.IO.Compression.FileSystem アセンブリを読み込みます(docxは実質ZIPファイルです)。
Add-Type -AssemblyName System.IO.Compression.FileSystem

#  エラーが起きても後片付け(ファイルの解放)を確実に行うための try ブロックを開始します。
try {
    #  Wordファイル(.docx)をZIPファイルとみなして、読み取り専用で開きます。
    $zip = [System.IO.Compression.ZipFile]::OpenRead($docxPath)
    #  ZIP内から、実際の文書データが保存されている 'word/document.xml' というファイルを探し出します。
    $entry = $zip.Entries | Where-Object { $_.FullName -eq 'word/document.xml' }
    
    #  目的のXMLファイル(document.xml)が無事見つかった場合の処理に入ります。
    if ($entry) {
        #  そのXMLファイルを読み込むためのデータストリーム(通り道)を開きます。
        $stream = $entry.Open()
        #  ストリームからテキストを読み取るための StreamReader オブジェクトを作成します。
        $reader = New-Object System.IO.StreamReader($stream)
        #  StreamReaderを使って、ファイルの内容を最初から最後まで一括で文字列として読み込みます。
        $xmlString = $reader.ReadToEnd()
        
        #  読み込んだ文字列データを、PowerShellで解析しやすい XMLオブジェクト に変換します。
        $xml = [xml]$xmlString
        #  XML内で使われている名前空間(タグのプレフィックス)を管理するマネージャーを作成します。
        $nsm = New-Object System.Xml.XmlNamespaceManager($xml.NameTable)
        #  docxファイルの仕様で定められている名前空間を、"w" というプレフィックスで登録します。
        $nsm.AddNamespace("w", "http://schemas.openxmlformats.org/wordprocessingml/2006/main")
        
        #  XPathと呼ばれる記法を使い、XML全体から「段落」を表す <w:p> タグをすべて取得します。
        $paragraphs = $xml.SelectNodes("//w:p", $nsm)
        #  すべての段落タグをループで回し、内部のテキストだけを抽出して配列 $text に格納します。
        $text = foreach ($p in $paragraphs) { $p.InnerText }
        
        # ==========================================
        # 抽出したテキストを専用のウィンドウで画面表示
        # ==========================================
        #  プレビューを表示するための新しいウィンドウ(フォーム)を作成します。
        $form = New-Object System.Windows.Forms.Form
        #  ウィンドウのタイトルにファイル名を含めて設定します。
        $form.Text = "docx ファイルの内容プレビュー - " + [System.IO.Path]::GetFileName($docxPath)
        #  ウィンドウのサイズを幅800、高さ600ピクセルに設定します。
        $form.Size = New-Object System.Drawing.Size(800, 600)
        #  ウィンドウが画面の中央に表示されるように設定します。
        $form.StartPosition = "CenterScreen"

        # 長文でも軽く表示できるRichTextBoxを使用
        #  大量の文章でもスムーズにスクロールできる RichTextBox オブジェクトを作成します。
        $rtb = New-Object System.Windows.Forms.RichTextBox
        #  RichTextBox をウィンドウ全体の領域いっぱいに広げて配置します。
        $rtb.Dock = "Fill"
        #  テキストを書き換えられないよう、読み取り専用に設定します。
        $rtb.ReadOnly = $true
        #  フォントを「メイリオ」のサイズ11に設定し、視認性を高めます。
        $rtb.Font = New-Object System.Drawing.Font("Meiryo", 11)
        #  配列に分かれていた各段落のテキストを、改行コード(`r`n)で連結して一つの文章として表示します。
        $rtb.Text = $text -join "`r`n"

        #  ウィンドウ(フォーム)の中に、設定した RichTextBox を追加(配置)します。
        $form.Controls.Add($rtb)
        #  ウィンドウを画面に表示し、ユーザーが閉じるまで待機します(戻り値は破棄)。
        [void]$form.ShowDialog()

    #  'word/document.xml' が見つからなかった場合の処理に入ります。
    } else {
        #  正しいWordファイルではない可能性があるため、見つからなかった旨を警告します。
        Write-Warning "document.xml が見つかりませんでした。"
    #  XMLファイル存在確認のif-else文を終了します。
    }
#  tryブロックの後、正常・異常にかかわらず必ず実行される finally ブロックに入ります。
} finally {
    #  StreamReader が開かれていれば、閉じてメモリを解放します。
    if ($reader) { $reader.Close() }
    #  Stream が開かれていれば、閉じてファイルのロックを解除します。
    if ($stream) { $stream.Close() }
    #  ZIPファイルが開かれていれば、破棄して完全にロックを解除します。
    if ($zip) { $zip.Dispose() }
#  try-finallyブロックを終了します。
}

2.ダイアログが表示されたら、内容を確認したい .docx ファイルを選択します。
3.デスクトップ中央にプレビューウィンドウが表示され、ファイル内の文章が確認できます(テキストのコピーも可能です)。

まとめ

.docx はZIPファイルである」というOpenXMLの仕組みと、PowerShell 5.1から手軽に使えるようになった.NETの圧縮・XML解析機能を組み合わせることで、重たいOfficeソフトに依存しない極めて軽量なビューアーが実現できます。

保守運用サーバーなどで「この設定手順書(Word)のメモ書きだけちょっと確認したい」といった場面に非常に重宝しますので、ぜひ活用してみてください。

0
2
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
2

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?