UTF-8 は、Unicode を 1〜4 バイトの可変長で符号化する方式です。文字の種類に応じて使うバイト数を変えるのが特徴です。
| 文字 | バイト数 |
|---|---|
| ASCII(英数字・記号) | 1 バイト |
| ラテン拡張・ギリシャ等 | 2 バイト |
| 日本語・中国語等 | 通常 3 バイト |
| 一部の絵文字等 | 4 バイト |
ASCII と互換性があり(ASCII 文字は 1 バイトのまま)、英語が多い文書ではサイズ効率が良いのが利点です。Web(HTML/HTTP)・JSON・XML・プログラムソースなどで事実上の世界標準になっています。
たとえば「A」は 1 バイト、「あ」は通常 3 バイトで表されます。そのため英数字だけの文書は小さく収まり、日本語を多く含む文書はそのぶんファイルサイズが大きくなります。
試験では 「ASCII 互換の可変長」「Web の標準」「日本語は通常 3 バイト」という点が問われます。