정규 표현식을 사용하여 텍스트 추출

사용자 정의 또는 미리 정의된 정규식을 사용하여 텍스트에서 특정 패턴을 추출합니다

일치 항목: 0

Regex 텍스트 추출기를 어떻게 사용하나요

정규 표현식(regex)을 사용하여 모든 텍스트에서 특정 데이터를 빠르고 정확하게 추출할 수 있는 정교한 온라인 애플리케이션입니다. 로그를 정리하는 개발자이신가요? 보고서를 해석하는 데이터 분석가이신가요? 연락처 정보를 얻으려는 마케터이신가요? 이 도구는 과정을 간단하게 만들어 줍니다. 텍스트를 붙여넣고, 패턴을 설정하면 즉시 일치하는 결과를 얻을 수 있습니다. UI는 유용한 사전 설정으로 초보자에게 맞춰져 있지만, 정교한 regex 플래그에 대한 완전한 제어를 원하는 전문가에게도 적합합니다. 패턴 매칭의 잠재력을 활용하고 시작하기 위한 단계는 다음과 같습니다.

  1. 텍스트를 입력하세요: 검색하려는 텍스트를 큰 텍스트 영역에 붙여넣거나 업로드하세요. '텍스트 파일 업로드' 버튼을 사용하여 .txt, .log, .csv 또는 .html 파일을 업로드할 수 있으며, '예제 보기'를 클릭하여 예제를 불러올 수도 있습니다.
  2. 정규식 패턴 정의하기: "정규 표현식 패턴" 열에 사용자 지정 정규식을 입력하세요. 이메일이나 전화번호 찾기와 같은 일반적인 활동의 경우, 사전 설정 버튼(예: "이메일", "URL")을 클릭하여 신뢰할 수 있는 패턴을 자동으로 채우세요.
  3. 경기 옵션
    • 전역 매치 (g): 텍스트에서 첫 번째 항목만이 아니라 모든 항목과 일치하도록 이것을 체크하세요.
    • 대소문자 구분 없음 (i): 검색은 대문자와 소문자를 구분하지 않습니다.
    • 멀티라인 (m): ^와 $의 동작을 문자열의 시작/끝이 아니라 각 행의 시작/끝과 일치하도록 변경합니다.
    • 점(.)은 모든 문자(s)와 일치합니다: 점(.) 문자가 줄바꿈 문자와도 일치하도록 합니다.
    • 결과를 줄바꿈으로 연결: 추출된 각 일치는 보기 쉽게 각자 별도의 줄에 형식화됩니다.
  4. 경기 추출: '일치 항목 추출' 버튼을 클릭하세요. 프로그램이 귀하의 텍스트를 분석하고 아래 결과 상자에 감지된 모든 패턴을 표시합니다. '찾은 항목' 카운터가 새로 고쳐집니다.
  5. 결과 내보내기: 추출한 텍스트를 클립보드로 복사하거나, .txt 파일로 다운로드하거나, CSV 또는 JSON과 같은 구조화된 형식으로 내보내 추가 분석에 사용할 수 있도록 도구 모음을 사용하세요.
  6. 전문가 팁: 추출한 후에는 '통계 보기' 옵션을 클릭하여 총 매치 수와 가장 빈번한 패턴과 같은 통계를 확인하세요.

정규식 추출의 일반적인 사용 사례

정규 표현식 추출은 데이터 처리와 텍스트 마이닝에 중요한 기술입니다. 이는 다양한 실제 상황을 신속하게 처리할 수 있도록 만들어졌습니다. 온라인 스크래핑에서 데이터 검증까지 정확한 패턴을 식별하는 것은 무수한 수작업 시간을 절약해 줍니다. 다음은 이 정규 표현식 추출기의 즉각적인 유용성을 제공하는 가장 일반적인 사용 사례 중 일부입니다.

  • 데이터 정리 및 준비: 데이터베이스로 가져오기 위해 정리되지 않은 로그나 사용자가 생성한 정보에서 제품 코드, 일련 번호 또는 ID와 같은 일관된 데이터 포인트를 추출합니다.
  • 리드 생성: 마케팅 또는 홍보 활동을 위해 웹사이트나 문서를 스크랩하여 이메일 주소와 전화번호를 식별하고 수집합니다.
  • 로그 파일 분석: 디버깅 및 모니터링을 위해 서버 또는 애플리케이션의 로그를 분석하여 오류 코드, 타임스탬프, IP 주소 또는 개별 트랜잭션 ID를 식별합니다.
  • 콘텐츠 관리: 감사 또는 마이그레이션 목적으로 웹 콘텐츠나 문서에서 모든 URL, 이미지 링크 또는 지정된 HTML 태그를 추출합니다.
  • 학술 및 연구: 연구 논문이나 녹취록과 같은 장문의 자료에서 특정 인용문, 날짜, 통계 자료 또는 키워드를 추출합니다.
  • 코드 리팩토링: 소프트웨어 유지보수 동안, 소스 코드 파일에서 모든 함수 이름, 변수 선언 또는 코드 패턴을 찾아내십시오.
  • 소셜 미디어 모니터링: 소셜 미디어 스트림이나 내보낸 댓글 섹션에서 해시태그, 멘션(@username) 또는 지정된 단어를 추출합니다.
  • 재무 문서 처리: 재무제표나 보고서에서 송장 번호, 금액, 날짜 및 고객 이름을 추출합니다.
  • 보안 감사: 하드코딩된 비밀번호, API 키, 안전하지 않은 프로토콜 참조와 같은 잠재적인 보안 취약점을 위해 구성 파일이나 코드를 검토합니다.

정규 표현식 플래그 해독

플래그(또는 수정자)는 정규 표현식 엔진이 패턴을 이해하는 방식을 수정하는 단일 문자입니다. 플래그는 검색의 범위와 동작을 조절하는 데 필수적입니다. 여기에서는 추출을 세밀하게 맞춤 설정할 수 있도록 가장 인기 있고 강력한 네 가지 플래그를 제공합니다. 이를 배우면 더 나은 효율적인 정규식 작성자가 될 수 있습니다.

  • 글로벌 (g) : 가장 일반적인 플래그입니다. 그렇지 않으면, 정규식 엔진은 텍스트에서 첫 번째 일치 후에 멈춥니다. 'g' 플래그가 설정되면 전체 입력 문자열에서 일치하지 않는 모든 값을 계속 검색하고 반환합니다.
  • 대소문자 구분 안 함 (i): 활성화하면 이 플래그는 패턴이 대소문자 차이를 무시하게 만듭니다. 예를 들어, 패턴 '/hello/i'는 'hello', 'Hello', 'HELLO', 'HeLlO'에 일치합니다. 이는 사용자 제공 텍스트에서 대문자 사용이 불균형할 때 스캔하는 데 중요합니다.
  • 멀티라인 (m): 이 플래그는 앵커 문자 `^` (문자열 시작)와 `$` (문자열 끝)의 동작을 수정합니다. 'm'이 활성화되면, ^는 전체 멀티라인 문자열의 시작이 아닌 각 줄의 시작과 일치하고, $는 각 줄의 끝과 일치합니다.
  • 모든 문자 포함 (s)기본적으로, 점 `.` 메타문자는 줄바꿈 문자(` `, ` `)를 제외한 모든 문자와 일치합니다. 's' 플래그는 이 제한을 제거하여 점이 모든 문자와 일치할 수 있게 합니다. 이것은 여러 줄에 걸친 텍스트를 파싱할 때 중요합니다.
  • 깃발 결합: 플래그는 결합하여 복잡한 효과를 만들 수 있습니다. 예를 들어 `gi`는 전체(global) 대소문자 구분 없는(case-insensitive) 검색을 수행합니다. GM은 텍스트를 한 줄씩(line by line) 파싱하는 데 자주 사용됩니다. 이 도구는 사용자가 선택한 플래그를 이러한 혼합된 방식으로 사용합니다.
  • 깃발 설치: 고전적인 정규 표현식에서는 플래그가 닫는 구분자 뒤에 옵니다(예: /pattern/gim). 이 도구는 복잡성을 숨기고, 단순히 체크박스를 선택하면 내부적으로 올바른 플래그를 가진 정규식 객체를 생성합니다.
  • 성능 고려: 전역(`g`) 플래그는 추출을 위해 필요하며, 특히 큰 텍스트의 경우 다소 더 많은 자원을 사용할 수 있습니다. 이것이 바로 이 도구가 잘 수행하도록 최적화된 작업입니다.
  • 실용적인 예: 여러 줄 로그에서 "Error:"로 시작하는 모든 줄을 일치시키고 싶다고 가정해 보겠습니다. 이 경우 패턴 ^Error:를 사용하고 둘 다 활성화하면 됩니다. 멀티라인 (m) 그리고 글로벌 (g) 깃발.

정규식 패턴 예제 및 결과

사용 사례정규식 패턴샘플 텍스트 & 추출된 일치
Extract Email Addresses
\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b
Text: Contact [email protected] or [email protected].
Match: [email protected], [email protected]

기본 정규식 문법 치트 시트

정규 표현식에서 문자 그대로의 문자와 특수 메타문자의 조합은 검색 패턴을 만듭니다. 정규 표현식은 배우기 약간 까다로울 수 있지만, 몇 가지 핵심 개념만 배우면 강력한 추출 패턴을 만들 수 있습니다. 이 도구의 패턴 필드에서 사용할 수 있는 가장 유용한 기호와 시퀀스에 대한 참고 자료는 다음과 같습니다.

  • . (닷): 새 줄 문자를 제외한 모든 문자와 일치합니다. 예: `a.c`는 "abc", "a@c", "a c"와 일치합니다.
  • \d 그리고 \w: `\d`는 모든 숫자(0-9)와 일치합니다. `\w`는 모든 단어 문자(영숫자와 밑줄)를 나타냅니다. 대문자 버전(`\D`, `\W`)은 반대(숫자가 아닌 것, 단어가 아닌 것)와 일치합니다.
  • [] (문자 클래스): 대괄호 안의 문자 중 하나와 일치합니다. `[aeiou]`는 모음과 일치합니다. `[A-Za-z]`는 대문자 또는 소문자 중 하나와 일치합니다. `[0-9]`는 `\d`와 동일합니다.
  • 수량사: 앞의 요소가 얼마나 반복될 수 있는지를 나타냅니다. `*` (0회 이상), `+` (1회 이상), `?` (0회 또는 1회), `{n}` (정확히 n회), `{n,}` (n회 이상), `{n,m}` (n회에서 m회 사이).
  • 앵커: `^`는 문자열(또는 'm' 플래그가 있는 경우 라인)의 시작과 일치합니다. $는 문자열(또는 라인의 끝)과 일치합니다. `\b`는 단어 경계(단어 문자와 비단어 문자 사이의 위치)와 일치합니다.
  • () (캡처 그룹): 패턴의 일부를 그룹화하고 일치하는 하위 문자열을 '캡처'하여 추출합니다. 이 도구는 각 일치 그룹에 대한 모든 자료를 제공합니다.
  • | (교대): 논리적 OR처럼 작동합니다. `cat|dog`는 'cat' 또는 'dog'에 일치합니다.
  • 탈출: 문자 그대로 특수 문자를 맞추고 싶다면, , * 아니면 ? 백슬래시로 탈출해야 합니다: \. , \* , \? .

자주 묻는 질문

새로운 사용자가 정규식(regex)과 추출 도구를 사용하기 시작할 때, 일반적으로 비슷한 질문을 합니다. 이 섹션에서는 도구를 더 잘 이해하고 문제를 해결하는 데 도움이 되는 가장 흔한 질문들을 다룹니다. 만약 여기에서 질문에 대한 답을 찾지 못했다면, 샘플 텍스트와 프리셋을 사용하여 패턴과 플래그가 어떻게 상호작용하는지 실험해 보세요.

정규 표현식(Regex)이란 무엇인가요?
정규 표현식은 검색 패턴을 설명하는 문자 패턴입니다. 이는 단순한 고정 문자열이 아니라, 지정된 규칙에 따라 텍스트를 일치시키고, 검색하며, 변경하기 위한 강력하고 간결한 언어입니다.
왜 내 정규식 패턴이 아무 것도 매치하지 않나요?
먼저 오타를 확인하세요. '예제 보기' 텍스트와 미리 정의된 패턴을 사용하여 도구를 시도해 보세요.
PDF나 워드 문서에서 텍스트를 얻을 수 있나요?
직접적으로는 아닙니다. 이것은 워드 프로세싱 도구입니다. PDF나 Word 문서에서 내용을 복사하여 입력 폼에 붙여넣거나, 문서를 .txt 파일로 저장한 후 업로드 도구를 사용해야 합니다.
다른 내보내기 형식에는 어떤 것들이 있나요 (TXT, CSV, JSON)?
TXT 기본적으로 한 줄씩 원시 추출된 매치를 저장합니다. CSV 각 매치를 단일 열의 개별 셀에 배치하여 스프레드시트에 적합합니다. JSON은 매치의 구조화된 배열을 생성하여 프로그래밍 애플리케이션에 이상적입니다.
온라인 도구에서 내 데이터는 안전한가요?
예. 모든 처리는 귀하의 웹 브라우저(클라이언트 측)에서 이루어집니다. 귀하의 텍스트는 당사 시스템으로 전송되지 않아 민감한 데이터가 안전하고 비공개로 유지됩니다.
정교한 정규 표현식에 대해 더 많이 알아보려면 어디서 찾아야 하나요?
많은 훌륭한 인터넷 자료, 튜토리얼 및 정규식 테스트 플랫폼이 있습니다. 프리셋으로 시작하고 약간 수정해 보며 어떤 일이 일어나는지 확인하세요. 이것은 상호작용적으로 배우는 훌륭한 방법입니다.