生成假文本
用外觀相似的 Unicode 字元替換字元,以創建用於測試目的的假/模擬文字。
如何使用假文生成器:逐步指南
- 輸入您的原始文本
- 將您的原始文本輸入或粘貼到標有「在此輸入文本以生成假版本…」的頂部文本框中。您可以輸入從一個句子到完整段落的任何內容。
- 或者,使用「載入範例」按鈕將欄位填入範例文字,或點擊「選擇檔案」按鈕,直接從您的電腦上傳 .txt 檔案以進行批量處理。
- 設定您的替換設定
- 在「替換選項」標籤下,選擇要更改的字元集。預設情況下,字母、數字和符號會被測試以達到最大混淆。
- 使用進階選項來精煉輸出:選擇「保持基本可讀性」以獲得較不激烈且更易讀的轉換,或選擇「僅使用同形字」以確保字元保持視覺上相似的形狀。
- 調整「替換強度」滑桿以設定可被更改的字符比例。較低的數值(例如 30%)將導致輕微偽造,而 100% 則保證完全轉換。
- 生成、複製並使用你的假文字
- 點擊「生成假文本」按鈕。您轉換後的文本將立即顯示在下方的只讀結果框中。
- 使用「複製結果」按鈕可將文字直接複製到剪貼簿,以便貼入表單、文件或測試環境。點擊「下載文字」可將輸出內容下載為 .txt 檔案以便離線使用或記錄。按下「全部清除」按鈕可重置工具以開始新的使用會話。
科技解析:假文本生成的機制
基本概念:Unicode 與同形字元
這個工具基於先進的 Unicode 字元替換概念。Unicode 標準大約有 144,000 個字元,包括數百種書寫系統和符號集。在這個龐大的資料庫中,有一些“同形字”——來自其他書寫系統,但外觀與常規拉丁字母驚人相似的字元。例如,西里爾字母 “а” (U+0430) 幾乎看起來與拉丁字母 “a” (U+0061) 一模一樣,但它們完全是不同的數位物件。我們的生成演算法會讀取你的輸入文字,根據你的選擇找到目標字母,然後系統地將它們替換成來自其他 Unicode 區塊的外觀相同的字元。 此程序產生的文字對人眼看起來正常,但其組成是不同的數位代碼,因此能夠成功地在許多技術和安全用途上偽造原始資訊。
- 字元對照資料庫: 該工具基於一個維護良好、經過整理的數據庫,該數據庫提供常見拉丁字符(a-z, A-Z)、數字(0-9)和符號(!、@、#)與它們在西里爾字母、希臘字母、數學運算符等中的最相似 Unicode 對應字符的映射。
- 智慧處理: 如果您啟用「保留可讀性」,演算法會偏好那些最不改變單詞形狀和空間的替換。「強度」參數的作用是將替換邏輯應用於使用者指定比例的符合條件字符,這些字符會被隨機選取,從而允許逐步的混淆程度。
- 情境感知回應: 生成器以可用文字的形式維持輸出,包含空格、換行和結構。它不會輸出隨機的胡言亂語,而是輸出與你的輸入一致、連貫的內容,可以通過簡單的目視檢查和模式匹配過濾器。
字元替換示例
| 原始字符 | 常見同形字替代 | Unicode 來源與註解 |
| a(拉丁小寫 a) | а(西里爾小寫 а) | U+0430。外觀相同。常用於進階仿冒(使用者名稱、網址)。 |
| e(拉丁小寫 e) | е(西里爾小寫 е) | U+0435。幾乎無法分辨的同形字,是構造看起來像英文的假文本的關鍵。 |
| o(拉丁小寫 o) | о(西里爾小寫 о) | U+043E。又一個視覺上完全相同的替換,不做數位分析往往看不出來。 |
| 1(數字一) | l(拉丁小寫 l)或 I(西里爾字母 Palochka) | U+006C 或 U+04C0。示範如何用字母或其他特殊字元偽裝數字以干擾系統。 |
假文本的實際應用和使用案例
- 軟體與表單驗證: 開發者與品質保證測試人員使用假文字來測試應用程式對國際字元集的支援、驗證輸入的淨化,以及測試與同形相關的安全漏洞,如 IDN(國際化網域名稱)偽造。有助於確保系統正確拒絕或編碼可能具誤導性的文字。
- 資料隱私與匿名化: 在分享包含敏感信息(姓名、電子郵件、身份證號碼等)的照片、模型或示範數據時,您可以使用此工具生成視覺上真實但完全虛假的占位文字。這可以在保護隱私的同時,保留資料或簡報的視覺上下文。
- 社交媒體與使用者名稱可用性檢查: 使用者可能會嘗試測試該平台的註冊系統是否能區分拉丁字母的“Instagram”和利用西里爾字母偽造的版本。這對於理解平台的安全性以及避免冒充威脅至關重要。
- 垃圾郵件過濾測試與數位內容創作: 內容行銷人員和安全研究人員可以製作各種素材來評估垃圾郵件過濾器、抄襲檢測器和內容審核演算法。這有助於回答這個問題:「這個系統會標記那些看起來正常但在數位上不同的文本嗎?」
- 網路安全教育用途: 這是同形字攻擊、網路釣魚策略(例如生成誤導性的網址)以及數位安全訓練和大學課程中對 Unicode 知識需求的一個實際示例。