偽のテキストを生成する

テスト目的のために、文字を視覚的に似ているUnicode文字に置き換えて偽の/スプーフテキストを作成します。

オプションを置き換える

フェイクテキストジェネレーターの使い方:ステップバイステップガイド

  1. あなたのソーステキストを入力してください
    • オリジナルのテキストを「偽バージョンを生成するためにここにテキストを入力」と表示されている上部のテキストボックスに入力または貼り付けてください。1文から全文の段落まで、何でも入力できます。
    • あるいは、「サンプルを読み込む」ボタンを使用してフィールドにサンプルテキストを入力するか、「ファイルを選択」ボタンをクリックして、コンピュータから直接.txtファイルをアップロードして一括処理することもできます。
  2. 置換設定を設定する
    • 「置換オプション」タブで、変更する文字セットを選択します。デフォルトでは、文字、数字、および記号が最大限の難読化のためにテストされます。
    • 高度なオプションで出力を洗練させます:「基本的な可読性を保持」を選択すると、より控えめで読みやすい変換になり、「同形異字のみを使用」を選択すると、文字の視覚的な形が比較可能なまま維持されます。
    • 「置換強度」スライダーを調整して、変更可能な文字の割合を設定します。値を低く設定すると(例えば30%)、変更は軽微になりますが、100%にすると完全な変換が保証されます。
  3. あなたの偽のテキストを生成、複製、そして活用する
    • 「偽テキストを生成」ボタンをクリックしてください。変換されたテキストは、下の読み取り専用の結果ボックスに即座に表示されます。
    • 「コピー結果」ボタンを使用して、テキストをクリップボードに直接コピーし、フォーム、ドキュメント、またはテスト環境に貼り付けることができます。「テキストをダウンロード」ボタンをクリックすると、出力を .txt ファイルとしてデバイスにダウンロードし、オフラインで使用したり記録を保持したりできます。「すべてクリア」ボタンは、ツールをリセットして新しいセッションを開始します。

技術解説:偽のテキスト生成の仕組み

基礎概念:ユニコードとホモグリフ

このツールは、Unicode文字の置換という高度な概念に基づいています。Unicode標準には、およそ144,000文字が含まれており、何百もの文字体系や記号セットがあります。そして、この膨大なライブラリの中には「ホモグリフ」— 他の文字体系から来ていて、通常のラテンアルファベットの文字に非常に似ている文字 — が存在します。たとえば、キリル文字の “а” (U+0430) は、ラテン文字の “a” (U+0061) とほとんど同じように見えますが、全く異なるデジタルオブジェクトです。私たちのジェネレーターアルゴリズムは、入力されたテキストを読み取り、あなたの選択に従って対象の文字を見つけ、他のUnicodeブロックから視覚的に同一の文字で体系的に置き換えます。 この手順により、人間の目には通常の文字のように見える文章が作成されますが、異なるデジタルコードで構成されているため、多くの技術的およびセキュリティ上の目的で元の情報を正確に偽装することが可能です。

  • 文字マッピングデータベース: このツールは、一般的なラテン文字(a-z、A-Z)、数字(0-9)、記号(!, @, #)をキリル文字、ギリシャ文字、数学記号などの最も近いUnicode類似文字にマッピングする、よく管理されたキュレーション済みのデータベースに基づいています。
  • スマート処理: 「可読性を保持」をオンにすると、アルゴリズムは単語の形やスペースを最も変えない置換を優先します。「強度」パラメータは、置換ロジックをユーザーが指定した割合の対象文字にランダムに適用することで、段階的な難読化のレベルを可能にします。
  • コンテキストに応じた応答: ジェネレーターは、スペース、改行、構造を備えた使用可能なテキストの形で出力を維持します。ランダムなナンセンスを出力するのではなく、目視による簡単な確認やパターンマッチングフィルターを通過できる、一貫した入力のコピーを出力します。

文字変換の例

元の文字 一般的な同形代替 ユニコードのソースとノート
a(ラテン小文字 a) а(キリル小文字 а) U+0430。見た目は同じ。高度ななりすまし(ユーザー名、URL)に使われます。
e(ラテン小文字 e) е(キリル小文字 е) U+0435。ほぼ見分けがつかない同形文字で、英語風の偽テキストを作る際の要です。
o(ラテン小文字 o) о(キリル小文字 о) U+043E。視覚的に同じ別の置換で、デジタル分析なしでは気づきにくいです。
1(数字の1) l(ラテン小文字 l)または I(キリル文字 Palochka) U+006C または U+04C0。文字や特殊記号で数字を偽装し、システムを混乱させる例です。

フェイクテキストの実際の応用と使用例

  • ソフトウェアおよびフォームの検証: 開発者やQAテスターは、国際的な文字セットのサポートをテストするため、入力のサニタイズを確認するため、そしてIDN(国際化ドメイン名)スプーフィングなどのホモグリフ関連のセキュリティ欠陥をテストするために、フェイクテキストを使用します。これは、システムが潜在的に誤解を招くテキストを正しく拒否またはエンコードすることを保証するのに役立ちます。
  • データプライバシーと匿名化: 名前、メール、IDなどの機密情報を含む写真、モックアップ、デモデータを共有する際には、このツールを使用して、視覚的にリアルでありながら完全に架空のプレースホルダーテキストを生成できます。これにより、資料やプレゼンテーションの視覚的な文脈を保持しながら、プライバシーを保護できます。
  • ソーシャルメディアとユーザー名の利用可能性チェック: ユーザーは、プラットフォームの登録システムがラテン文字の「Instagram」とキリル文字を使用した偽のバージョンを区別できるかテストしようとするかもしれません。これは、プラットフォームのセキュリティを理解し、なりすましの脅威を回避するために重要です。
  • スパムフィルタのテストとデジタルコンテンツの作成: コンテンツマーケターやセキュリティ研究者は、スパムフィルター、盗作検出器、コンテンツモデレーションアルゴリズムを評価するための多様な資料を作成することができます。これは、次の疑問に答えるのに役立ちます:「このシステムは、一見正常に見えるがデジタル的に異なるテキストを検出するだろうか?」
  • サイバーセキュリティ教育目的: これは、ホモグリフ攻撃、フィッシング戦略(例:誤解を招くURLの生成)、およびデジタルセキュリティの訓練や大学のコースのためのUnicodeの知識の必要性に関する実践的な例です。