Tra cứu Unicode
Dán một ký tự bí ẩn, khoảng trắng lạ mà người dùng đã dán, một ký tự từ bản xem trước phông chữ hay một emoji làm hỏng regex của bạn, và công cụ tra cứu trả về điểm mã Unicode (U+XXXX) và các byte UTF-8 thô ở dạng thập lục phân, mỗi ký tự một dòng.
Cách nhận diện ký tự Unicode
-
1
Dán ký tự
Bạn có thể dán một ký tự hoặc cả một chuỗi: mỗi ký tự được phân tích theo thứ tự.
-
2
Đọc điểm mã
Nhận ký hiệu U+ chuẩn, viết hoa và đệm số 0 tới ít nhất bốn chữ số thập lục phân.
-
3
Kiểm tra byte UTF-8
Xem chuỗi 1–4 byte mà ký tự chiếm trên ổ đĩa hoặc khi truyền.
-
4
Sao chép kết quả
Đầu ra là một bảng dạng CSV (ký tự, điểm mã, byte UTF-8) mà bạn có thể chọn và dán vào bảng tính hoặc báo cáo lỗi.
Công việc điều tra điển hình bạn có thể làm với công cụ tra cứu
Hầu hết lỗi Unicode trông giống hệt nhau trên màn hình. Cách duy nhất để phân biệt một khoảng trắng thường với khoảng trắng không ngắt, hay một dấu lược cong với dấu phút, là kiểm tra điểm mã.
Những cái bẫy thường gặp mà công cụ tra cứu giải quyết
| Trông giống | Thực chất là | Điểm mã |
|---|---|---|
| Khoảng trắng | Khoảng trắng không ngắt | U+00A0 |
| Khoảng trắng | Khoảng trắng hẹp không ngắt | U+202F |
| (không gì) | Khoảng trắng rộng bằng không | U+200B |
| (không gì) | Ký tự nối rộng bằng không | U+200D |
| Dấu lược | Dấu ngoặc đơn phải | U+2019 |
| Dấu lược | Dấu phút (feet/phút) | U+2032 |
| Dấu nối | Gạch ngang ngắn | U+2013 |
| Dấu nối | Dấu nối không ngắt | U+2011 |
Bố cục byte UTF-8 trong nháy mắt
- 1 byte, ASCII, U+0000 đến U+007F (
0xxxxxxx) - 2 byte, phần bổ sung Latin, Ả Rập, Do Thái (
110xxxxx 10xxxxxx) - 3 byte, CJK, hầu hết ký hiệu (
1110xxxx 10xxxxxx 10xxxxxx) - 4 byte, emoji, chữ viết hiếm (
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)
Nếu cột cơ sở dữ liệu của bạn có độ dài byte cố định, một emoji 4 byte sẽ chiếm bốn ô dù chỉ hiển thị thành một ký tự, một nguyên nhân phổ biến gây lỗi cắt cụt.
Câu hỏi thường gặp
Thường là dấu BOM (U+FEFF) ở đầu tệp hoặc ký tự nối rộng bằng không sót lại từ trình xử lý văn bản. Dán một cái vào công cụ tra cứu, nó sẽ cho bạn biết ngay, rồi bạn xóa chúng bằng thao tác tìm-và-thay đơn giản.
Có. Công cụ tra cứu duyệt từng ký tự, nên cả một từ sẽ cho mỗi ký tự một dòng kèm điểm mã và byte UTF-8.
Điểm mã là danh tính trừu tượng của một ký tự: U+00E9 luôn là “é” dù bạn lưu ở đâu. UTF-8 là một trong nhiều bảng mã biến điểm mã thành byte; cùng chữ “é” đó là hai byte C3 A9 trong UTF-8 nhưng chỉ một byte E9 trong Latin-1.
Có. Việc tra cứu được tính trên máy chủ của chúng tôi: các ký tự bạn dán được gửi đi, phân tích, rồi điểm mã và byte UTF-8 được trả về ngay. Chúng tôi không lưu văn bản bạn gửi.
Công cụ liên quan
Trình tạo font Instagram
Tạo "font" Unicode (đậm, nghiêng, viết tay, đẳng khoảng, fraktur) để dán thẳng vào bio, tên, caption và bình luận Instagram của bạn.
Trình tạo tên thành phố
Tạo tên thành phố, thị trấn, làng và thủ đô hư cấu cho xây dựng thế giới, bản đồ, game, truyện và dữ liệu giả lập, kèm ghi chú ngắn cho từng kết quả.
Trình tìm cờ emoji
Tìm emoji cờ của 195 quốc gia theo tên địa phương, tên tiếng Anh hoặc mã hai chữ cái. Kiểm tra chuỗi Unicode và sao chép ngay trong trình duyệt.
Bộ tạo phông chữ Discord
Chuyển văn bản bình thường thành các kiểu chữ Unicode phù hợp với tên dùng trong Discord, tên máy chủ và tin nhắn, bao gồm các dạng đậm, nghiêng, fraktur, monospace và dạng trang trí.
Trình dịch chữ nổi Braille
Dịch văn bản sang chữ nổi Braille Unicode cấp 1 và giải mã Braille trở lại thành chữ cái. Xử lý chữ hoa, chữ số và dấu câu.
Trình tạo văn bản Gothic
Chuyển văn bản thường thành các ký tự Unicode kiểu blackletter (Fraktur): 𝔄 𝔅 ℭ 𝔇. Sao chép và dán vào phần tiểu sử, biểu ngữ hoặc đồ họa của ban nhạc metal.
Công cụ này có phiên bản bằng các ngôn ngữ khác
- Pencarian Unicode [ID]
- Wyszukiwarka Unicode [PL]
- Unicode opzoeken [NL]
- Unicode-uppslagning [SV]
- ค้นหา Unicode [TH]
- Unicode-Suche [DE]
- Unicode検索 [JA]
- 유니코드 조회 [KO]
- Búsqueda de Unicode [ES]
- Pesquisa de Unicode [PT]
- Recherche Unicode [FR]
- بحث يونيكود [AR]
- Unicode Lookup [EN]
- Ricerca Unicode [IT]
- Поиск символов Unicode [RU]
- Unicode Arama [TR]
- Unicode 字符查找 [ZH]