HTML 텍스트 추출기 — 태그 제거와 본문 복사
HTML에서 텍스트 추출, 문단 유지와 링크 주소 포함 옵션
브라우저에서 처리 · 서버로 전송되지 않음
HTML을 실행하거나 화면에 삽입하지 않고 텍스트만 추출합니다. 스크립트·스타일·hidden·aria-hidden 내용은 제외합니다. CSS에 따른 실제 표시 여부는 계산하지 않으며 pre 공백도 정리합니다.
사용법
- 웹페이지 소스나 이메일의 HTML을 입력하세요.
- 문단·줄바꿈 유지 여부를 선택하세요.
- 링크 목적지도 필요하다면 링크 주소도 포함을 켜세요.
- 결과 텍스트를 복사해 메모나 문서에 사용하세요.
추출 기준
태그를 정규식으로 삭제하지 않고 브라우저의 HTML 파서로 구조를 읽습니다. HTML 엔티티는 한 번 해석하며 한글, 중국어, 이모지를 유지합니다. p, div, 제목, 목록, 표의 행처럼 블록에 해당하는 요소에는 줄 경계를 넣습니다. 표의 셀 사이에는 공백을 넣습니다. 단일 줄 옵션을 선택하면 연속 공백과 줄바꿈을 하나의 공백으로 정리합니다.
script, style, title, template, noscript와 임베드 콘텐츠는 제외합니다. hidden 속성이 있거나 aria-hidden이 true인 요소도 건너뜁니다. 이미지의 대체 텍스트와 폼 입력값은 별도로 추출하지 않으며 CSS가 결정하는 시각적 배치는 재현하지 않습니다. 링크 주소는 실행 가능한 링크가 아닌 일반 텍스트로 붙습니다.
예시
<p>한글 & 中文</p><p>😀</p>에서 문단을 유지하면 두 문단의 텍스트를 얻습니다. <a href="/guide">가이드</a>는 주소 포함 옵션에서 가이드 (/guide)가 됩니다.
제한과 개인정보
입력은 100만 자, DOM 탐색은 128단계까지 제한합니다. 잘못 닫힌 HTML은 브라우저의 복구 규칙을 따릅니다. 입력과 결과를 서버에 보내지 않습니다.
자주 묻는 질문
스크립트나 외부 이미지가 실행되나요?
아니요. 입력은 화면에 붙이지 않는 비활성 템플릿에서 읽고 결과를 텍스트로만 표시합니다. 스크립트와 스타일 내용은 제외합니다.
화면에서 보이는 글자만 추출하나요?
완전히 같지는 않습니다. hidden과 aria-hidden 요소는 제외하지만 외부 CSS, display 설정이나 레이아웃은 계산하지 않습니다.
줄바꿈과 공백은 그대로 남나요?
문단 유지 옵션은 블록 요소와 br의 줄바꿈을 반영합니다. 연속 공백과 pre 내부 공백은 정리하므로 원문 공백을 그대로 보존하는 도구는 아닙니다.