使用自定义或预定义的正则表达式从文本中提取特定模式
一个复杂的在线应用程序,让你能够使用正则表达式(regex)快速且准确地从任何文本中提取特定数据。你是清理日志的开发者吗?解读报告的数据分析员?获取联系方式的市场人员?这个工具让这一过程变得简单。粘贴你的文本,设置你的模式,即可立即获得匹配结果。用户界面针对初学者提供了有用的预设,同时也为专家提供对复杂正则标志的完全控制。以下是入门步骤及利用模式匹配潜力的方法。
全局匹配 (g):勾选此项以匹配文本中的所有出现,而不仅仅是第一个。不区分大小写 (i)搜索不区分大写字母和小写字母。多行 (m):将 ^ 和 $ 的行为更改为匹配每一行的开头/结尾,而不仅仅是字符串的开头/结尾。点匹配所有(s):使点(.)字符也匹配换行符。正则表达式提取是数据处理和文本挖掘中的一项重要技能。它能够快速处理许多不同的实际情况。从在线抓取到数据验证,识别精确模式可以节省大量的人工劳动时间。以下是一些该正则表达式提取器最常见的用例,它们具有即时的实用价值。
标志(或修饰符)是单个字母,用于修改正则表达式引擎对你的模式的理解。它们对于调节搜索的范围和行为至关重要。它提供了四个最流行且强大的标志,使你能够精细地定制你的提取。学习它们将使你成为更优秀、更高效的正则表达式编写者。
| 用例 | 正则表达式模式 | 示例文本和提取的匹配 |
|---|---|---|
Extract Email Addresses | \b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b | Text: Contact [email protected] or [email protected]. Match: [email protected], [email protected] |
在正则表达式中,字面字符和特殊元字符的组合可以创建搜索模式。正则表达式可能有点难学,但如果你只掌握几个关键概念,你就可以构建强大的提取模式。这里是一个参考,列出了你可以在此工具的模式字段中使用的最有用的符号和序列。
. (点): 匹配除换行符之外的任意字符。例如: `a.c` 匹配 "abc"、"a@c"、"a c"。\d 和 \w: `\d` 匹配任何数字 (0-9)。`\w` 匹配任何单词字符(字母数字加下划线)。大写版本(\D, \W)匹配相反的(非数字,非单词) 。[] (字符类):匹配括号内的任意单个字符。`[aeiou]` 匹配任意元音字母。`[A-Za-z]` 匹配任意大写或小写字母。`[0-9]` 等价于 `\d`。() (捕获组):将模式的一部分分组,并“捕获”匹配的子字符串以便提取。此工具将为您提供每个匹配组的所有材料。| (交替): 这起到逻辑 OR 的作用。`cat|dog` 匹配 “cat” 或 “dog” 中的任意一个。当新用户开始使用正则表达式和提取工具时,他们通常会有类似的问题。在本节中,我们将涵盖一些最常见的问题,以帮助您更好地排除故障并理解该工具的可能性。如果您的问题在这里没有得到解答,可以尝试使用示例文本和预设来了解模式和标志是如何相互作用的。
TXT 保存原始提取的匹配项,默认每行一个。 CSV 将每个匹配项放入单列中的不同单元格,非常适合电子表格。JSON 会生成一个结构化的匹配数组,非常适合编程应用。