Công Cụ Kiểm Tra Mojibake
Phép so sánh riêng tư này không còn khả dụng
Mở công cụ đầy đủ trên một trangDán văn bản có vẻ bị lỗi
Dán văn bản như café hoặc chuỗi tiếng Nhật trở nên khó đọc do bảng mã không khớp. Văn bản gốc trong trình soạn thảo vẫn được giữ nguyên.
Tối đa 50.000 ký tự. Công cụ này chỉ so sánh văn bản Unicode được dán; công cụ không kiểm tra hoặc sửa tệp, luồng byte, cơ sở dữ liệu hay tiêu đề HTTP.
Mojibake là dữ liệu hiển thị thành các ký tự sai do byte được giải mã bằng một bộ ký tự không tương thích. Ví dụ quen thuộc là café, xuất hiện khi café được mã hóa bằng UTF-8 nhưng các byte bị diễn giải thành Latin-1 hoặc Windows-1252. Hãy dán văn bản đang hiển thị để so sánh các giả thuyết khôi phục có thể chuyển đổi ngược chính xác. Công cụ giữ nguyên văn bản gốc, ghi rõ từng ứng viên chỉ là giả thuyết và thực hiện việc so sánh ngay trong trình duyệt.
Cách so sánh một giả thuyết khôi phục mojibake
-
1
Dán văn bản đang hiển thị
Dùng đúng nội dung bạn nhận được. Công cụ không tải lên hoặc kiểm tra tệp nguồn.
-
2
Đồng ý thực hiện so sánh
Yêu cầu trình duyệt kiểm tra cách diễn giải byte Latin-1 và Windows-1252 bằng bộ giải mã UTF-8 nghiêm ngặt.
-
3
So sánh, không phỏng đoán
Đọc văn bản gốc không thay đổi bên cạnh từng ứng viên khả nghịch và chỉ chọn khi ngữ cảnh ủng hộ.
-
4
Dùng dưới dạng văn bản thuần túy
Sao chép, tải xuống hoặc in giả thuyết đã chọn mà không ghi đè văn bản gốc.
Giả thuyết khôi phục có thể và không thể xác định điều gì
Mã hóa xác lập quan hệ giữa ký tự và byte. UTF-8 biểu diễn é bằng hai byte C3 A9. Nếu phần mềm giải mã các byte này thành Windows-1252 hoặc ISO-8859-1, kết quả hiển thị có thể là é. Một giả thuyết hữu ích đảo ngược đúng kiểu sai lệch đó: xem các ký tự theo bảng mã cũ đang hiển thị là giá trị byte, giải mã nghiêm ngặt các byte thành UTF-8, rồi xác minh rằng việc mã hóa lại ứng viên bằng UTF-8 tạo ra đúng các byte ban đầu.
Phép kiểm tra khứ hồi loại bỏ chuỗi UTF-8 không đầy đủ hoặc sai định dạng. Ứng viên chứa ký tự thay thế � cũng bị loại vì thông tin ở vị trí đó đã mất. Khứ hồi hợp lệ chỉ là bằng chứng ủng hộ một giả thuyết, không chứng minh hệ thống nguồn đã dùng bảng mã nào hay tác giả định viết gì.
| Văn bản hiển thị | Giả thuyết được kiểm tra | Ứng viên có thể có | Điều cần xác minh |
|---|---|---|---|
café |
Byte UTF-8 bị đọc thành Latin-1 | café |
Đối chiếu cách viết với nguồn |
It’s |
Byte UTF-8 bị đọc thành Windows-1252 | It’s |
Kiểm tra dấu câu và quy tắc trình bày |
æååã |
Byte UTF-8 bị đọc thành Latin-1 | 文字化け |
Đối chiếu tiếng Nhật với bản đáng tin cậy |
café |
Hai lỗi mã hóa nối tiếp nhau | café |
Kiểm tra cả hai lượt có kiểm soát |
Vì sao văn bản tiếng Nhật cần ngữ cảnh
Khi byte UTF-8 của tiếng Nhật bị giải mã theo một bảng mã cũ không phù hợp, văn bản có thể biến thành chuỗi dài gồm chữ Latinh, ký hiệu và ký tự giống mã điều khiển. Khả năng chuyển đổi ngược giúp thu hẹp ứng viên, nhưng một tên ngắn hoặc ký tự riêng lẻ vẫn có thể mơ hồ. Hãy đối chiếu ứng viên với tài liệu gốc, nguồn xuất cơ sở dữ liệu, người gửi hoặc một bản sao có thẩm quyền khác.
Giới hạn và cách khôi phục an toàn hơn
Công cụ này nhận văn bản Unicode mà trình duyệt đã giải mã. Công cụ không thể lấy lại byte đã bị loại bỏ trước đó, suy ra bảng mã từ tệp nhị phân, sửa cột cơ sở dữ liệu hoặc thay đổi tiêu đề HTTP Content-Type. Nếu không có ứng viên, hãy giữ nguyên văn bản gốc. Khi có thể, hãy lấy byte nguồn thực tế, tạo bản sao lưu, xác định cả bảng mã được khai báo lẫn bảng mã thực rồi chỉ giải mã một lần bằng công cụ dành cho tệp hoặc luồng byte. Không lưu lặp lại văn bản hỏng đè lên bản nguồn duy nhất.
Câu hỏi thường gặp
Không. Điều đó chỉ có nghĩa một cách diễn giải byte theo bảng mã cũ đã giải mã thành UTF-8 hợp lệ và vượt qua phép khứ hồi byte chính xác. Nhiều cách diễn giải có thể tạo ra văn bản dễ đọc giống hoặc khác nhau. Bạn vẫn cần ngữ cảnh và một nguồn có thẩm quyền.
Các ký tự đang hiển thị có thể không phải byte UTF-8 bị đọc nhầm thành ISO-8859-1 hoặc Windows-1252, chuỗi có thể chưa đầy đủ, hoặc ký tự thay thế đã làm mất thông tin. Hãy giữ nguyên văn bản gốc và kiểm tra byte thực cùng siêu dữ liệu mã hóa.
Không. Công cụ chỉ so sánh văn bản Unicode được dán. Công cụ không đọc tệp, phát hiện bảng mã tệp, kết nối cơ sở dữ liệu, ghi lại giá trị đã lưu hoặc sửa tiêu đề máy chủ. Hãy sao lưu nguồn trước khi dùng quy trình chuyển đổi theo byte.
Không. Việc so sánh, chọn ứng viên, sao chép, tạo TXT và chuẩn bị in đều diễn ra trong trình duyệt. Chế độ phễu có thể giữ một bản ghi đã xác thực trong thẻ này tối đa 30 phút và URL chỉ chứa mã công việc không tiết lộ nội dung.
Công cụ liên quan
Công cụ xáo chữ
Xáo chữ cái trong từng từ nhưng giữ chữ đầu và chữ cuối. Phù hợp cho câu đố, trò chơi chữ và bài luyện đọc.
Trình tạo thư mục tài liệu tham khảo
Tạo mục tài liệu tham khảo đúng định dạng theo APA 7, MLA 9, Chicago 17 và Harvard. Hỗ trợ sách, tạp chí, trang web, phim và nhiều nguồn khác.
Công cụ diễn đạt lại
Viết lại câu tiếng Anh bằng các chế độ đồng nghĩa, rút gọn, trang trọng và đơn giản, rồi kiểm tra ý nghĩa và nguồn trích dẫn.
Trình tạo trích dẫn AMA
Tạo tài liệu tham khảo kiểu AMA cho bài báo tạp chí, sách, website và chương sách với chữ cái đầu tên tác giả, DOI, URL và ngày truy cập.
Trình kiểm tra ngữ pháp tiếng Anh
Kiểm tra nhanh ngữ pháp và chính tả cho văn bản tiếng Anh: phát hiện lỗi gõ sai thường gặp, thiếu dấu nháy đơn trong dạng rút gọn và từ bị lặp.
Trình tạo trích dẫn ACS
Tạo tài liệu tham khảo kiểu ACS cho bài báo tạp chí, sách, chương sách và website với các trường DOI, URL, trang và ngày truy cập.