入稿後の手戻りを防ぐ!テキストエディタで文字化けを直す方法、変換不能文字を修正

この記事で直す「文字化け」は、正しく読めている原稿の中に、納品先の文字コードへ変換できない文字が残っている場合です。誤った文字コードで開いて全体が「縺」などに崩れたファイルや、すでに壊れたバイト列の復元は扱いません。その場合は、先にBOMと読込み時の文字コードを確認してください。

今回Rune Studioで扱ったのは1,800文字の複製原稿です。変換候補5件を別欄へ出し、意味を確認して承認した代替だけをUTF-8の別名原稿へ反映し、開き直して1,800文字を照合しました。

候補を見つけた時点では直さない

変換不能文字が赤く表示されても、似た文字へ即座に変えるのは危険です。たとえば旧字体の人名、私用領域のロゴ文字、絵文字では、代替の決め方が違います。

候補表には最低でも六つの欄を作ります。

位置 候補文字 前後文 承認者 代替文字 状態
4行目 外字候補A 著者名の一部 著者 承認待ち 保留
12行目 絵文字 引用文の末尾 編集者 (笑) 承認
21行目 外字候補B 地名 校閲 通用字体 承認

同じ候補が複数箇所に出ても、固有名詞と一般語を一括で同じ文字へ変えないでください。前後文まで見て一件ずつ採否を決めます。

1,800文字の複製を直す手順

正本と候補一覧を分ける

source/manuscript-sjis.txt を work/manuscript-fix.txt へ複製します。正本のファイル名、文字コード、文字数を残し、候補一覧は別のメモへ書きます。

原稿全体が読めない場合はここで中止します。それは「読める本文の変換不能文字」ではなく、読込み文字コードの問題かもしれません。

五件の位置と文脈を採る

候補ごとに、行番号または文字位置、前後20文字ほど、固有名詞か一般語かを記録します。5件という総数だけでは、修正後にどの判断をしたか追えません。

承認済みの代替だけを反映する

著者名は著者、引用は編集者、専門用語は担当者に確認します。候補の意味はRune Studioが自動決定したものではありません。承認欄が空の候補を残したまま、一括置換しないでください。

UTF-8で別名保存する

修正後は out/manuscript-approved-utf8.txt のような別名へ保存します。正本を上書きせず、候補表に保存先を追記します。

閉じて再読込みする

別名原稿を閉じ、out/ から開き直します。今回の標本では、候補5件を承認代替した後、UTF-8別名原稿が1,800文字で再読込みできました。候補位置の前後文も一覧と照合します。

「直った」と判断する条件

承認が取れない候補は保留する

締切が近くても、人名や地名の代替を推測で決めないでください。承認者へ連絡できない候補は、候補表の状態を「保留」にし、本文へ勝手な代替を入れません。納品形式が許すならUTF-8のまま渡す、注記を添える、該当箇所だけ担当者へ返すなど、意味を壊さない選択を先に検討します。

同じ外字が12箇所にある場合も、最初の一箇所で承認を取り、その承認が同じ固有名詞の全箇所へ適用できるか確認します。異なる語に見た目の同じ候補が使われているなら別判断です。候補数と承認件数が一致しないまま、警告表示をゼロにすることを目標にしないでください。

保留した候補は別名原稿の名前にも反映します。approved と名付けられない状態なら pending-1 のようにし、完成版と取り違えないようにします。保存先の名前も修正判断の一部です。

合格条件は単に候補表示が消えたことではありません。

文字数が同じでも、誤った代替なら不合格です。逆に、必要な注記を加えたため文字数が変わる場合は、その理由を記録します。

Rune Studioができることの境界

Rune Studioの公開機能では、主要な日本語文字コードの判定、変換不能文字の表示、問題解消までの自動保存停止が案内されています。今回確認したのは候補5件の分離、承認代替、UTF-8別名原稿の再読込みです。

破損済みデータの完全復元、誤った復号の自動修復、OCR、バイナリ修復、代替文字の意味判断は含みません。全体が読めない場合は、BOMと読込み判定を調べる文字コード確認から始めます。

結論

テキストエディタで文字化けを直すとき、変換不能文字の修正は位置→前後文→承認者→代替→別名保存→再読込みの順で進めます。今回の1,800文字標本では、この順で5件を処理して同じ文字数を再確認できました。

まず正しく読める複製を作り、最初の一件だけ候補表へ移してください。日本語文字コードと変換不能文字を確認したい人は、Rune Studioの商品ページで現行の対応範囲を確認できます。