Công Cụ Kiểm Tra Mojibake

So sánh giả thuyết về bảng mã
Văn bản bạn dán và mọi ứng viên chỉ nằm trong trình duyệt này. Chế độ phễu giữ một bản ghi đã xác thực trong thẻ này tối đa 30 phút và chỉ đưa một mã công việc không tiết lộ nội dung vào URL. Không có dữ liệu nào được gửi qua máy chủ của chúng tôi hay API khôi phục.

Dán văn bản có vẻ bị lỗi

Dán văn bản như café hoặc chuỗi tiếng Nhật trở nên khó đọc do bảng mã không khớp. Văn bản gốc trong trình soạn thảo vẫn được giữ nguyên.

Tối đa 50.000 ký tự. Công cụ này chỉ so sánh văn bản Unicode được dán; công cụ không kiểm tra hoặc sửa tệp, luồng byte, cơ sở dữ liệu hay tiêu đề HTTP.

Mojibake là dữ liệu hiển thị thành các ký tự sai do byte được giải mã bằng một bộ ký tự không tương thích. Ví dụ quen thuộc là café, xuất hiện khi café được mã hóa bằng UTF-8 nhưng các byte bị diễn giải thành Latin-1 hoặc Windows-1252. Hãy dán văn bản đang hiển thị để so sánh các giả thuyết khôi phục có thể chuyển đổi ngược chính xác. Công cụ giữ nguyên văn bản gốc, ghi rõ từng ứng viên chỉ là giả thuyết và thực hiện việc so sánh ngay trong trình duyệt.

Cách so sánh một giả thuyết khôi phục mojibake

  1. 1

    Dán văn bản đang hiển thị

    Dùng đúng nội dung bạn nhận được. Công cụ không tải lên hoặc kiểm tra tệp nguồn.

  2. 2

    Đồng ý thực hiện so sánh

    Yêu cầu trình duyệt kiểm tra cách diễn giải byte Latin-1 và Windows-1252 bằng bộ giải mã UTF-8 nghiêm ngặt.

  3. 3

    So sánh, không phỏng đoán

    Đọc văn bản gốc không thay đổi bên cạnh từng ứng viên khả nghịch và chỉ chọn khi ngữ cảnh ủng hộ.

  4. 4

    Dùng dưới dạng văn bản thuần túy

    Sao chép, tải xuống hoặc in giả thuyết đã chọn mà không ghi đè văn bản gốc.

Giả thuyết khôi phục có thể và không thể xác định điều gì

Mã hóa xác lập quan hệ giữa ký tự và byte. UTF-8 biểu diễn é bằng hai byte C3 A9. Nếu phần mềm giải mã các byte này thành Windows-1252 hoặc ISO-8859-1, kết quả hiển thị có thể là é. Một giả thuyết hữu ích đảo ngược đúng kiểu sai lệch đó: xem các ký tự theo bảng mã cũ đang hiển thị là giá trị byte, giải mã nghiêm ngặt các byte thành UTF-8, rồi xác minh rằng việc mã hóa lại ứng viên bằng UTF-8 tạo ra đúng các byte ban đầu.

Phép kiểm tra khứ hồi loại bỏ chuỗi UTF-8 không đầy đủ hoặc sai định dạng. Ứng viên chứa ký tự thay thế cũng bị loại vì thông tin ở vị trí đó đã mất. Khứ hồi hợp lệ chỉ là bằng chứng ủng hộ một giả thuyết, không chứng minh hệ thống nguồn đã dùng bảng mã nào hay tác giả định viết gì.

Văn bản hiển thị Giả thuyết được kiểm tra Ứng viên có thể có Điều cần xác minh
café Byte UTF-8 bị đọc thành Latin-1 café Đối chiếu cách viết với nguồn
It’s Byte UTF-8 bị đọc thành Windows-1252 It’s Kiểm tra dấu câu và quy tắc trình bày
文字化け Byte UTF-8 bị đọc thành Latin-1 文字化け Đối chiếu tiếng Nhật với bản đáng tin cậy
café Hai lỗi mã hóa nối tiếp nhau café Kiểm tra cả hai lượt có kiểm soát

Vì sao văn bản tiếng Nhật cần ngữ cảnh

Khi byte UTF-8 của tiếng Nhật bị giải mã theo một bảng mã cũ không phù hợp, văn bản có thể biến thành chuỗi dài gồm chữ Latinh, ký hiệu và ký tự giống mã điều khiển. Khả năng chuyển đổi ngược giúp thu hẹp ứng viên, nhưng một tên ngắn hoặc ký tự riêng lẻ vẫn có thể mơ hồ. Hãy đối chiếu ứng viên với tài liệu gốc, nguồn xuất cơ sở dữ liệu, người gửi hoặc một bản sao có thẩm quyền khác.

Giới hạn và cách khôi phục an toàn hơn

Công cụ này nhận văn bản Unicode mà trình duyệt đã giải mã. Công cụ không thể lấy lại byte đã bị loại bỏ trước đó, suy ra bảng mã từ tệp nhị phân, sửa cột cơ sở dữ liệu hoặc thay đổi tiêu đề HTTP Content-Type. Nếu không có ứng viên, hãy giữ nguyên văn bản gốc. Khi có thể, hãy lấy byte nguồn thực tế, tạo bản sao lưu, xác định cả bảng mã được khai báo lẫn bảng mã thực rồi chỉ giải mã một lần bằng công cụ dành cho tệp hoặc luồng byte. Không lưu lặp lại văn bản hỏng đè lên bản nguồn duy nhất.

Câu hỏi thường gặp

Không. Điều đó chỉ có nghĩa một cách diễn giải byte theo bảng mã cũ đã giải mã thành UTF-8 hợp lệ và vượt qua phép khứ hồi byte chính xác. Nhiều cách diễn giải có thể tạo ra văn bản dễ đọc giống hoặc khác nhau. Bạn vẫn cần ngữ cảnh và một nguồn có thẩm quyền.

Các ký tự đang hiển thị có thể không phải byte UTF-8 bị đọc nhầm thành ISO-8859-1 hoặc Windows-1252, chuỗi có thể chưa đầy đủ, hoặc ký tự thay thế đã làm mất thông tin. Hãy giữ nguyên văn bản gốc và kiểm tra byte thực cùng siêu dữ liệu mã hóa.

Không. Công cụ chỉ so sánh văn bản Unicode được dán. Công cụ không đọc tệp, phát hiện bảng mã tệp, kết nối cơ sở dữ liệu, ghi lại giá trị đã lưu hoặc sửa tiêu đề máy chủ. Hãy sao lưu nguồn trước khi dùng quy trình chuyển đổi theo byte.

Không. Việc so sánh, chọn ứng viên, sao chép, tạo TXT và chuẩn bị in đều diễn ra trong trình duyệt. Chế độ phễu có thể giữ một bản ghi đã xác thực trong thẻ này tối đa 30 phút và URL chỉ chứa mã công việc không tiết lộ nội dung.

Công cụ liên quan