Xóa thẻ HTML

Dán mã đánh dấu HTML và công cụ này sẽ xóa mọi thẻ, chỉ để lại phần văn bản nằm giữa chúng. Nó chạy hàm chuẩn strip_tags của PHP: mọi thứ nằm trong dấu ngoặc nhọn (<p>, <br>, <div class="...">, các thẻ đóng và <!-- chú thích -->) đều bị xóa, còn văn bản xung quanh được giữ nguyên đúng như cũ. Bạn cũng nhận được ba bộ đếm: số ký tự trước, số ký tự sau và bao nhiêu ký tự đã bị xóa.

Cách hoạt động

  1. 1

    Dán mã đánh dấu

    Một đoạn mã HTML, một trang đầy đủ được sao chép từ Xem nguồn, hoặc nội dung email ở định dạng HTML.

  2. 2

    Xóa các thẻ

    Nhấn nút, mọi thẻ, thẻ đóng và chú thích HTML sẽ bị xóa trong một lượt duy nhất trên máy chủ.

  3. 3

    Xem các bộ đếm

    Thống kê hiển thị số ký tự trước và sau, cùng số ký tự đã bị xóa.

  4. 4

    Sao chép văn bản thuần

    Kết quả là một chuỗi sạch, sẵn sàng cho trình soạn thảo văn bản, bảng tính, câu lệnh AI hoặc quá trình xử lý tiếp theo.

Nó làm gì và không làm gì

strip_tags là một công cụ xóa thẻ nhanh và theo đúng nghĩa đen. Nó không phải là một bộ chuyển đổi HTML sang văn bản hoàn chỉnh, vì vậy biết chính xác ranh giới ở đâu sẽ rất hữu ích.

  • Thẻ bị xóa, văn bản được giữ lại. <b>bold</b> text trở thành bold text. Thẻ mở, thẻ đóng và các thuộc tính của chúng đều biến mất.
  • Chú thích HTML bị xóa. <!-- note -->visible trở thành visible.
  • Không chèn thêm ngắt dòng. Các thẻ khối như <p><div> chỉ đơn giản bị xóa, nên <p>One</p><p>Two</p> trở thành OneTwo. Các ngắt dòng đã có sẵn trong văn bản của bạn được giữ nguyên.
  • Thực thể không được giải mã. Tom &amp; Jerry vẫn là Tom &amp; Jerry. Để chuyển &amp; trở lại thành &, hãy đưa kết quả qua một bộ giải mã thực thể HTML.
  • Văn bản của script và style vẫn còn. Chỉ các thẻ <script><style> bị xóa; phần mã hoặc CSS nằm giữa chúng vẫn còn. Hãy tự xóa những khối đó trước nếu bạn không muốn chúng.

Trước và sau

Đầu vào Đầu ra
<p>Hello</p> Hello
<a href="https://x.com">click</a> click
<b>bold</b> text bold text
<!-- note -->visible visible
<br><br> (trống)
Tom &amp; Jerry Tom &amp; Jerry

Các trường hợp dùng phổ biến

  • Dọn dẹp đầu ra của CMS. Trích phần văn bản chính từ một bài viết đã xuất và lưu dưới dạng .txt thuần.
  • Cấp dữ liệu cho mô hình ngôn ngữ. Mô hình làm việc tốt hơn với văn bản thuần so với mã đánh dấu, vì vậy hãy xóa các thẻ trước khi viết câu lệnh.
  • Dọn dẹp dữ liệu thu thập. Khi một công cụ thu thập trả về innerHTML nhưng bạn chỉ muốn phần văn bản hiển thị.
  • Trích văn bản nhanh. Dán bất kỳ đoạn HTML nào và đọc lại các từ mà không có mã đánh dấu xung quanh.

Nên biết

  • Nơi xử lý. Việc xử lý diễn ra trên máy chủ của chúng tôi. Chỉ số ký tự trước và sau được ghi lại cho mục đích phân tích, không bao giờ ghi lại chính mã HTML, nhưng như với mọi công cụ trực tuyến, hãy tránh dán dữ liệu thực sự nhạy cảm.
  • Thực thể và script. Nếu đầu ra vẫn hiển thị &amp; hoặc JavaScript còn sót lại, đó là điều bình thường: hãy giải mã thực thể riêng và xóa các khối <script> / <style> trước khi dán.

Câu hỏi thường gặp

Không. Nó chỉ xóa các thẻ, nên những thực thể như &amp;, &nbsp;&#39; sẽ đi qua nguyên vẹn. Hãy đưa kết quả qua một bộ giải mã thực thể HTML nếu bạn cần các ký tự thật.

Không. Các thẻ khối như <p><div> bị xóa mà không chèn ngắt dòng, nên các đoạn văn có thể dính vào nhau. Các ngắt dòng đã có sẵn trong văn bản của bạn được giữ lại.

Bản thân các thẻ bị xóa, nhưng phần văn bản JavaScript hoặc CSS nằm giữa chúng vẫn còn trong đầu ra. Hãy xóa những khối đó trước khi dán nếu bạn không muốn mã.

Có. Các khối <!-- ... --> bị xóa cùng với các thẻ.

Trên máy chủ của chúng tôi, qua một lượt strip_tags duy nhất. Công cụ chỉ ghi lại số ký tự trước và sau, không ghi nội dung HTML của bạn.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác