Tra cứu Unicode

Dán một ký tự bí ẩn, khoảng trắng lạ mà người dùng đã dán, một ký tự từ bản xem trước phông chữ hay một emoji làm hỏng regex của bạn, và công cụ tra cứu trả về điểm mã Unicode (U+XXXX) và các byte UTF-8 thô ở dạng thập lục phân, mỗi ký tự một dòng.

Cách nhận diện ký tự Unicode

  1. 1

    Dán ký tự

    Bạn có thể dán một ký tự hoặc cả một chuỗi: mỗi ký tự được phân tích theo thứ tự.

  2. 2

    Đọc điểm mã

    Nhận ký hiệu U+ chuẩn, viết hoa và đệm số 0 tới ít nhất bốn chữ số thập lục phân.

  3. 3

    Kiểm tra byte UTF-8

    Xem chuỗi 1–4 byte mà ký tự chiếm trên ổ đĩa hoặc khi truyền.

  4. 4

    Sao chép kết quả

    Đầu ra là một bảng dạng CSV (ký tự, điểm mã, byte UTF-8) mà bạn có thể chọn và dán vào bảng tính hoặc báo cáo lỗi.

Công việc điều tra điển hình bạn có thể làm với công cụ tra cứu

Hầu hết lỗi Unicode trông giống hệt nhau trên màn hình. Cách duy nhất để phân biệt một khoảng trắng thường với khoảng trắng không ngắt, hay một dấu lược cong với dấu phút, là kiểm tra điểm mã.

Những cái bẫy thường gặp mà công cụ tra cứu giải quyết

Trông giống Thực chất là Điểm mã
Khoảng trắng Khoảng trắng không ngắt U+00A0
Khoảng trắng Khoảng trắng hẹp không ngắt U+202F
(không gì) Khoảng trắng rộng bằng không U+200B
(không gì) Ký tự nối rộng bằng không U+200D
Dấu lược Dấu ngoặc đơn phải U+2019
Dấu lược Dấu phút (feet/phút) U+2032
Dấu nối Gạch ngang ngắn U+2013
Dấu nối Dấu nối không ngắt U+2011

Bố cục byte UTF-8 trong nháy mắt

  • 1 byte, ASCII, U+0000 đến U+007F (0xxxxxxx)
  • 2 byte, phần bổ sung Latin, Ả Rập, Do Thái (110xxxxx 10xxxxxx)
  • 3 byte, CJK, hầu hết ký hiệu (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 byte, emoji, chữ viết hiếm (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Nếu cột cơ sở dữ liệu của bạn có độ dài byte cố định, một emoji 4 byte sẽ chiếm bốn ô dù chỉ hiển thị thành một ký tự, một nguyên nhân phổ biến gây lỗi cắt cụt.

Câu hỏi thường gặp

Thường là dấu BOM (U+FEFF) ở đầu tệp hoặc ký tự nối rộng bằng không sót lại từ trình xử lý văn bản. Dán một cái vào công cụ tra cứu, nó sẽ cho bạn biết ngay, rồi bạn xóa chúng bằng thao tác tìm-và-thay đơn giản.

Có. Công cụ tra cứu duyệt từng ký tự, nên cả một từ sẽ cho mỗi ký tự một dòng kèm điểm mã và byte UTF-8.

Điểm mã là danh tính trừu tượng của một ký tự: U+00E9 luôn là “é” dù bạn lưu ở đâu. UTF-8 là một trong nhiều bảng mã biến điểm mã thành byte; cùng chữ “é” đó là hai byte C3 A9 trong UTF-8 nhưng chỉ một byte E9 trong Latin-1.

Có. Việc tra cứu được tính trên máy chủ của chúng tôi: các ký tự bạn dán được gửi đi, phân tích, rồi điểm mã và byte UTF-8 được trả về ngay. Chúng tôi không lưu văn bản bạn gửi.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác