Unicode文字検索

文字 コードポイント 10進数 ブロック UTF-8 UTF-16 HTMLエンティティ

コード値 → 文字

文字 コードポイント 10進数 ブロック UTF-8 UTF-16 HTMLエンティティ

Unicodeコードポイントとは

コンピューターが表示できるすべての文字(アルファベット、数字、記号、CJK文字、絵文字)には、Unicode標準でコードポイントと呼ばれる一意の番号が割り当てられており、通常「U+」に続けて16進数で表記します(例:「A」はU+0041)。このツールは入力したテキストを文字ごとに分解し、それぞれのコードポイント・10進数値・Unicodeブロック・最も一般的な2つのエンコード方式でのバイト表現を表示するほか、コード値から文字を逆引きする機能も提供します。

検索の仕組み

テキストを入力すると、このツールは1文字ずつ処理し、JavaScript標準のUnicode対応文字列メソッドでコードポイントを読み取り、参照テーブルからそのコードポイントが属するUnicodeブロック名(「Basic Latin」や「CJK Unified Ideographs」など)を調べます。さらにUTF-8・UTF-16エンコードでの生のバイト値と、対応するHTML数値文字参照も計算します。逆引き機能はU+XXXX、0x16進数、通常の10進数、文字1個など複数の形式で入力されたコード値を受け付け、同じ情報を表示します。

よくある質問

UTF-8とUTF-16のバイトは何が違いますか?
どちらも同じUnicodeコードポイントをバイトにエンコードする方式ですが、バイトのまとめ方や埋め方が異なります。UTF-8は1文字あたり1〜4バイトを使い、Webで最も広く使われているエンコードです。一方UTF-16(JavaScriptの文字列が内部的に使用)は1文字あたり2バイトまたは4バイトを使います。
一部の文字が文字そのものではなく「Space」「Tab」「Control」と表示されるのはなぜですか?
空白・タブ・改行やコードポイント32未満のその他の非表示制御文字には目に見えるグリフがないため、セルを空欄にしたり見えない文字をそのまま表示したりする代わりに、読みやすいラベルで代替表示しています。
一度に解析できるテキストの長さに制限はありますか?
ページの応答性を保つため、表は分解結果を最大1000文字まで表示します。入力したテキストがそれより長い場合は表示が省略された旨の案内が出ますが、文字数の合計とバイトサイズはテキスト全体を基準に計算されます。