本文へ移動
ZEKILO Dev

文字数・バイト数カウント

テキストを貼り付けると、文字数と文字コードごとのバイト数をすぐに表示します。

入力はブラウザの外に出ませんWHATWG EncodingUAX #29基準日 2026.10.03

入力

Escを押してからTabを押すと、入力欄から移動できます。

結果

文字数とバイト数
文字数0見た目の1文字単位:絵文字の組み合わせは1文字
空白を除いた文字数0
コードポイント数0
UTF-16の長さ0JavaScript・Javaの length と同じ
UTF-8 バイト数0
EUC-KR(CP949)バイト数0
Shift_JIS(CP932)バイト数0
行数0
単語数0

文字数・バイト数カウントの使い方

  1. 1入力欄にテキストを貼り付けるか、「例を入れる」を押します。テキストファイルは「ファイルを開く」で開けます。
  2. 2結果の表で文字数とUTF-8・Shift_JIS・EUC-KRのバイト数を確認します。文字数制限を入力すると、残りの文字数や超えた文字数が表の上に表示されます。
  3. 3表の各行にあるコピーボタンで、必要な値をコピーします。

文字数・バイト数カウントのオプション

改行のバイト数
改行1つをLF(1バイト、既定)として数えるか、CRLF(2バイト)として数えるかを選びます。バイト数の3行だけに使われます。Windowsで保存するファイルや、改行がCRLFの固定長データに入れるテキストならCRLFを選んでください。
文字数制限
数値を入力すると、文字数を基準に残りの文字数または超えた文字数を表示します。0は制限なしです。例:Xの投稿 280、エントリーシート 400。

文字数を数える基準

同じテキストでも、数える単位によって長さが変わります。このツールの「文字数」は、Unicodeの UAX #29 が定める書記素クラスター、つまり画面で1文字に見える単位です。👍🏻 はコードポイントが2個、UTF-16のコードユニットが4個ですが、1文字として数えます。JavaScriptやJavaの length はUTF-16のコードユニット数なので、「UTF-16の長さ」の行と同じ値です。

空白を除いた文字数は、スペース・タブ・改行と全角スペース(U+3000)を除いた数です。行数は改行の数に1を足した値で、空の入力は0行です。

Shift_JIS・EUC-KRのバイト数

EUC-KRはCP949(MS949)、Shift_JISはCP932(Windows-31J)を基準にしています。システムによって異なる場合があります。ブラウザが使う WHATWG Encoding Standard がこの2つの名前をそのように定義しており、WindowsやJavaのWindows-31J・MS949も同じ表を使います。

Shift_JISでは、半角カナ(カ)は1バイト、全角のかな・漢字は2バイトです。① や 髙 のようにJIS X 0208にない文字は、CP932の拡張領域にあります。受け取る側のシステムが拡張領域に対応していないと同じ文字が文字化けすることがあるので、固定長データや古いデータベースに入れるテキストは、相手側の基準もあわせて確認してください。

狭い意味のEUC-KR(KS X 1001)にはハングルが2,350字しかなく、똠 のような文字がありません。CP949は残りの8,822字を拡張領域に入れ、現代ハングル11,172字をすべて2バイトで表します。

文字数・バイト数カウントの例

  • ハングルと英字 — 12文字

    Shift_JISにはハングルがないため、5文字を表現できません。

    入力

    안녕하세요 ZEKILO

    出力

    UTF-16 12 · UTF-8 22 · EUC-KR 17 · Shift_JIS —
  • ひらがなと英字 — 12文字

    EUC-KRのもとになるKS X 1001には、かなが含まれています。

    入力

    こんにちは ZEKILO

    出力

    UTF-16 12 · UTF-8 22 · EUC-KR 17 · Shift_JIS 17
  • 絵文字の組み合わせとハングル — 2文字、3コードポイント

    親指の絵文字と肌の色の修飾文字は、画面では1文字です。

    入力

    👍🏻가

    出力

    UTF-16 5 · UTF-8 11 · EUC-KR — · Shift_JIS —
  • KS X 1001にないハングル — 4文字

    最初の文字はKS X 1001にはありませんが、CP949の拡張領域にあり、2バイトで数えます。

    入力

    똠방각하

    出力

    UTF-16 4 · UTF-8 12 · EUC-KR 8 · Shift_JIS —
  • JIS X 0208にない文字 — 2文字

    どちらもCP932の拡張領域にある文字です。EUC-KRには「髙」がありません。

    入力

    ①髙

    出力

    UTF-16 2 · UTF-8 6 · EUC-KR — · Shift_JIS 4

例は、このツールを検証している基準ケースの値です。

文字数・バイト数カウントのよくある質問

入力したデータはサーバーに送信されますか?

いいえ。入力と結果はこのブラウザ内だけで処理され、保存もしません。再読み込みすると消えます。

Shift_JISのバイト数はどの基準で数えていますか?

EUC-KRはCP949(MS949)、Shift_JISはCP932(Windows-31J)を基準にしています。システムによって異なる場合があります。全角のかな・漢字は2バイト、半角の英数字と半角カナは1バイトで数え、その文字コードにない文字が含まれるときは、バイト数の代わりに「—」と表現できない文字の数を表示します。

絵文字や結合文字は何文字として数えますか?

文字数は、画面で1文字に見える単位(書記素クラスター)で数えます。肌の色が付いた絵文字、国旗、家族の絵文字、濁点が付いた半角カナはどれも1文字です。コードポイント数とUTF-16の長さは別の行に表示するので、プログラムの length の値と比べられます。

全角文字は何バイトですか?

全角のかな・漢字は、Shift_JIS(CP932)では2バイト、UTF-8では3バイトです。そのため「こんにちは ZEKILO」はShift_JISで17バイト、UTF-8で22バイトになります。データベースの列や固定長の項目のようにバイト数で制限される場合は、どの文字コードかを先に確認してください。

文字数の上限はどう確認しますか?

文字数制限に 400 のような数値を入力すると残りの文字数が表示され、超えたときは超過した文字数が強調されます。空白を数えない書式なら「空白を除いた文字数」の行をご覧ください。

「—」と表示される行は何ですか?

その文字コードで表現できない文字が含まれているという意味です。たとえばShift_JISにはハングルがなく、Shift_JISとEUC-KRのどちらにも絵文字がありません。何文字あるかは、行の下と表の下のお知らせに表示されます。

処理方法・標準

  • 処理する場所:このブラウザ(お使いの端末)。送信も保存もしません。
  • 標準: WHATWG Encoding · UAX #29
  • エンジン: ZEKILO Dev 文字数・バイト数カウンター (自社実装) · EUC-KR・Shift_JISの変換表(WHATWG Encoding の index から生成) (BSD 3-Clause (WHATWG))
  • 文字の区切りにはブラウザの Intl.Segmenter を使います。対応していないブラウザではコードポイントで数え、その旨を表示します。
  • 表現できない文字の数はコードポイント単位です。
  • 単語数は空白で区切った数なので、空白のない文は1として数えます。
  • 基準日 2026.10.03
  • 変更履歴: 2026.10.03 公開
オープンソースライセンス →
結果がおかしい場合は、エラーを報告する(入力内容は添付されません)