文字化け・BOM・改行コードを切り分ける

似ているようで別の問題。読み込み時の設定と、変換の順番を整理します。

最終更新日:2026年9月26日

最初に元の文字を正常に読む

文字化けは、保存時と読み込み時の文字コードが一致していないために起こることがあります。UTF-8やShift_JISなど、元ファイルに合う設定で日本語が読めるか先に確認します。

「?」や代替文字へ置き換えられた状態で上書きすると、元の文字情報が失われる場合があります。変換は原本のコピーで行い、出力前に固有名詞や記号を確認してください。

BOMは文字コードそのものの変換ではない

UTF-8のBOMは、ファイル先頭に置かれる判別用の情報です。読み込み先によってはUTF-8の認識を助けますが、不要または禁止とされるシステムもあります。

Shift_JISのファイルへBOMだけを付けてもUTF-8にはなりません。必要なら先に文字コードを変換してから、出力先が求めるBOMの有無を選びます。

改行と文字の表記は別に整える

LFとCRLFの違いは改行の表し方で、日本語の文字コードとは別です。取り込み先の仕様がCRLFなら改行コード変換で揃え、行数や空行が意図どおりか確認します。

全角・半角の統一や重複行の削除は、データの内容を変える操作です。IDやパスワードのように1文字の違いが重要な値に一括適用しないでください。文字数も提出先のルールによって数え方が変わる場合があります。

関連する無料ツール