Цифровые инструменты

Почему вместо иероглифов квадраты или неправильные знаки: диагностика

Как отличить проблему шрифта от ошибки кодировки, PDF или приложения, проверить китайский символ и не подменить исходный текст догадкой.

Ноутбук с нейтральным размытым экраном рядом с очками и блокнотом
Иллюстрация, созданная с помощью ИИ. Спокойная диагностика отображения текста на компьютере.

Квадрат вместо иероглифа: сначала понять, что именно сломалось

Белый квадрат, рамка с вопросительным знаком, пустое место или странный знак на месте китайского текста вызывают соблазн «поставить любой китайский шрифт». Иногда это действительно помогает, но часто маскирует другую проблему: неверную кодировку файла, повреждённый текстовый слой PDF, подменённый символ, особый вариант иероглифа или ограничение конкретного приложения. Правильная диагностика начинается не со скачивания шрифтов, а с разделения уровней: какие символы записаны в файле, умеет ли программа их обрабатывать и есть ли у выбранного шрифта нужные глифы.

Unicode называет типичным признаком нехватки шрифтовой поддержки missing glyph, часто визуально похожий на «tofu» — квадрат. В справке Unicode также отмечается, что причина может быть в неактуальной поддержке продукта, собственной логике выбора шрифтов у приложения или в том, что поставщик не включил редкие символы. Следовательно, квадрат не доказывает, что текст испорчен, и не говорит сам по себе, какой шрифт нужен.

Пять разных симптомов, которые нельзя лечить одинаково

Квадрат или рамка

Чаще всего это знак, для которого активный шрифт не имеет подходящего глифа либо приложение не смогло найти шрифт-замену. Проверьте ту же строку в другом современном приложении и в другом браузере. Если там символ виден, исходный текст, вероятно, сохранён корректно, а проблема локальна для программы, документа или набора шрифтов.

Набор вроде 学校 вместо иероглифов

Это похоже не на отсутствие глифа, а на ошибку декодирования: байты UTF-8 прочитали как однобайтовую кодировку. Установка шрифта не вернёт исходный текст, потому что приложение уже интерпретировало байты не тем способом. В веб-файле нужно проверить объявление кодировки и фактическое сохранение UTF-8; в CSV или текстовом экспорте — параметры импорта. Не пересохраняйте единственный файл вслепую: сначала сделайте копию и определите, где возникла подмена.

Иероглиф виден, но выглядит «не так»

Форма одного и того же Unicode-символа может заметно отличаться в китайском, японском и корейском шрифте. Это не обязательно ошибка: типографская традиция и региональная локализация дают разные глифические формы. Проблема возникает, когда документ на китайском принудительно отображается шрифтом, ориентированным на другую традицию, или когда графика несёт учебное, библиографическое либо редакторское значение. Сверяйте не только наличие знака, но и то, соответствует ли его форма языку и источнику.

Крупный план страницы с типографскими образцами без читаемого текста
Иллюстрация, созданная с помощью ИИ. Шрифт рисует форму символа, но не меняет его значение.

Один знак пропал в PDF

В PDF может быть встроен неполный шрифт, изображение вместо текста, слой OCR или нестандартное сопоставление кодов. Проверьте, можно ли выделить и скопировать символ. Сравните, что видно на странице и что попадает в буфер. Если они расходятся, не исправляйте цитату только по копированию: для чтения приоритет у визуального источника, а для технической диагностики нужны оба наблюдения.

Знаки портятся только в одном приложении

Тогда сначала обновите это приложение и его компонент рендеринга, а не всю систему. Браузер, офисный редактор, PDF-просмотрщик и мессенджер могут по-разному выбирать fallback-шрифт. Если документ открывается корректно в другом приложении на том же компьютере, это сильный признак, что проблема не в самом тексте. Сохраните пример и версию программы: такой отчёт полезнее фразы «китайский не работает».

Быстрый диагностический маршрут

  1. Скопируйте проблемный символ в простую заметку и посмотрите, отображается ли он там.
  2. Откройте тот же источник во втором приложении или браузере. Не меняйте оригинальный файл на этом шаге.
  3. Если видите квадрат, проверьте, одинаков ли он везде. Если да — ищите поддержку символа и версию системы; если нет — локальный шрифт или приложение.
  4. Если видите латинскую «кашу», остановитесь и проверьте кодировку файла или импорт, а не шрифты.
  5. Если форма странная, сравните её с китайским источником и уточните, не используется ли японский либо корейский шрифт.
  6. Для одного редкого знака найдите кодовую точку и сведения о вариантах в Unihan, затем подберите шрифт с явным покрытием нужного диапазона.
  7. После исправления снова откройте файл на другом устройстве или в другом приложении. Одна удачная картинка на вашем экране ещё не означает переносимость.

Этот маршрут нужен не ради технической педантичности. Он защищает от опасного сценария: автор видит на своём компьютере верный знак, сохраняет документ, а получатель видит квадрат или другую форму. Чем важнее текст — цитата, имя, учебный материал, сертификат, подпись к изображению, — тем обязательнее проверка вне исходного редактора.

Шрифт, кодировка и Unicode: три разных уровня

Unicode-символ — абстрактная единица текста с кодовой точкой. Кодировка описывает, как эта единица хранится в байтах, например UTF-8. Шрифт рисует глиф на экране или бумаге. Упрощённая модель полезна: она объясняет, почему корректный UTF-8-файл может показывать квадраты при плохом шрифте и почему красивый установленный шрифт не лечит байты, уже прочитанные в неправильной кодировке.

Два устройства на рабочем столе с размытыми экранами
Иллюстрация, созданная с помощью ИИ. Сравнение отображения текста в разных приложениях.

На практике добавляется четвёртый уровень — рендеринг приложения. Оно решает, какой шрифт применить к основному тексту, какую замену искать для отсутствующего глифа, как учитывать язык документа и какие OpenType-таблицы использовать. Поэтому «шрифт установлен» ещё не означает, что конкретная программа выберет его автоматически. Иногда достаточно назначить шрифт стилю документа; иногда проблема остаётся, потому что текст является картинкой или повреждённым PDF-слоем.

Как проверять символ без догадок

Когда виден подозрительный знак, сохраните его отдельно и зафиксируйте, откуда он взят. Если копирование работает, вставьте символ в несколько приложений. Затем найдите его в Unihan или другом техническом справочнике. База Unicode позволяет искать идеографы по свойствам; так можно подтвердить, что перед вами конкретный Han ideograph, посмотреть чтения и связанные данные. Не нужно превращать каждую заметку в программирование, но умение отличить символ от его рисунка помогает не «чинить» несуществующую ошибку.

Если символ не копируется или меняется при вставке, сфотографируйте экран, сохраните исходный файл и отметьте приложение. При сложном документе это важнее, чем ручная замена на похожий иероглиф. Похожий знак может иметь другую кодовую точку, другое чтение или относиться к варианту, значимому для источника.

Выбор шрифта для учебного и редакционного текста

Для обычного современного китайского текста выбирайте хорошо поддерживаемый шрифт с явно заявленной поддержкой CJK, а не декоративный «Chinese font» из случайного архива. Важны лицензия, покрытие нужной графики, наличие упрощённых и/или традиционных форм, читаемость в малом кегле и поведение в PDF. Если материал будет открываться на чужих устройствах, при экспорте PDF проверьте встраивание шрифтов или подготовьте документ так, чтобы он не зависел от установленного на компьютере получателя гарнитурного набора.

Не смешивайте много шрифтов в одном абзаце ради борьбы с единичными квадратами. Это создаёт скачки начертания, интерлиньяжа и региональной формы, а иногда скрывает проблему в исходных данных. Сначала установите, каких именно знаков не хватает; затем найдите один подходящий fallback или основной шрифт. Для редких исторических иероглифов может понадобиться специальное покрытие — его надо тестировать на реальных знаках, а не по рекламному названию гарнитуры.

Рука держит лист с нейтральными печатными знаками рядом с экраном
Иллюстрация, созданная с помощью ИИ. Сверка цифрового текста с исходным носителем.

Сценарий: текст в браузере

Если на сайте видны квадраты, откройте страницу в другом браузере и сделайте снимок адреса, версии и участка текста. Если проблема только в одном браузере, проверьте обновления, пользовательские стили, расширения для смены шрифтов и настройки масштабирования. Если квадрат видят все, владелец сайта должен проверить CSS-стек шрифтов и наличие файлов шрифта на сервере. Пользователь не должен угадывать правильный иероглиф по обрывку кода страницы.

Для автора страницы важно указывать разумный стек с CJK-поддержкой и тестировать не только самые частые знаки. В то же время не стоит утверждать, что одна гарнитура покрывает весь китайский Unicode: редкие расширения Han занимают огромный диапазон, и их поддержка различается. Набор тестов должен содержать реальные знаки из публикации.

Сценарий: документ Word или заметки

Выделите проблемный фрагмент и назначьте ему тот же CJK-совместимый шрифт, что использован в основной части. Затем сохраните копию и откройте её в другом редакторе. Если иероглифы превратились в латинскую последовательность, отмените ручные правки и вернитесь к исходному импорту: вероятна кодировка. Если квадраты исчезли только на вашем компьютере, подготовьте PDF и проверьте его на другой системе до отправки.

Автозамена и интеллектуальные кавычки редко являются причиной квадрата, но могут изменить соседний текст или пробелы. Для цитаты сравнивайте всё предложение с источником после любого массового форматирования. Отдельный символ можно восстановить по словарю или Unihan, но нельзя реконструировать весь документ на основе предположений.

Папка с документами, флеш-накопитель и карандаш на столе
Иллюстрация, созданная с помощью ИИ. Сохранение исходного файла до технических правок.

Сценарий: PDF, скачанный из архива

Начните с проверки, является ли страница сканом. Если да, вопросы отображения и распознавания разделяются: изображение может выглядеть верно, а поиск и копирование не работать. Если текстовый слой есть, сравните его с видимой страницей. При квадратах в старом PDF попробуйте другой просмотрщик, но не редактируйте исходник. Для точной цитаты используйте визуальную страницу как объект сверки и фиксируйте страницу, издание и устойчивую ссылку.

Чего не стоит делать

  • Не устанавливайте шрифты с непроверенных сайтов под видом «исправления китайского».
  • Не заменяйте квадрат первым похожим иероглифом из поиска.
  • Не меняйте кодировку исходного файла без копии и понимания формата.
  • Не превращайте изображение страницы в текст без пометы, что он получен OCR и выверен или не выверен.
  • Не судите о корректности по одному приложению и одному устройству.

Короткое сообщение можно перепроверить за минуту. Архивную публикацию, договор, медицинский текст или библиографическую запись лучше не «чинить» вручную вообще, пока не найден исходный файл или компетентный источник. Техническая неисправность не оправдывает создание новой ошибки в содержании.

Итог: диагностировать, а не угадывать

Квадрат — это симптом. Сначала выясните, виден ли тот же текст в другом приложении, копируется ли исходный символ и как именно выглядит ошибка. Затем выбирайте ветку: шрифт и fallback, кодировка, форма глифа, PDF-слой или приложение. После исправления проверяйте реальный файл на втором устройстве. Такой порядок бережёт и время, и сами иероглифы: они остаются данными источника, а не материалом для визуальной догадки.

Справки

О причинах missing glyph и квадратов см. Unicode Display Problems и FAQ Unicode о неподдерживаемых символах. Для поиска сведений о конкретном иероглифе используйте Unihan Database Search.

Редакционная помета

Редакционный материал, подготовленный с помощью ИИ по указанным источникам. Не является авторской публикацией Елены Емельченковой.

Источники

Вопрос по материалу: связаться с редакцией.