Поддержка кодировок в Digital Q.DataBase
позволяет хранить текст в различных кодировках (также называемых наборами символов), включая однобайтовые кодировки (например, серию ISO 8859) и многобайтовые кодировки, такие как EUC (Extended Unix
Code), UTF-8 и внутренний код Mule. Все поддерживаемые кодировки
могут прозрачно использоваться клиентами, но некоторые из них не поддерживаются
непосредственно сервером (то есть в качестве серверной кодировки).
Кодировка по умолчанию выбирается при
инициализации Digital Q.DataBase кластера баз
данных с помощью initdb. Данный параметр можно переопределить при создании базы данных, что позволяет использовать несколько баз данных с различными кодировками.
Однако важным ограничением является то, что кодировка каждой базы данных должна быть совместима с настройками LC_CTYPE (классификация
символов) и LC_COLLATE (порядок сортировки строк) локали.
Для C или
POSIX локали допускается любая кодировка, но для других локалей, предоставляемых libc, существует только одна кодировка, которая будет работать корректно. (Однако в Windows кодировка UTF-8 может использоваться с любой локалью.) Если настроена поддержка ICU, локали ICU можно использовать с большинством, но не со всеми серверными кодировками.
Таблица 3.8.3 содержит список кодировок, доступных для использования в Digital Q.DataBase.
Таблица 3.8.3. Digital Q.DataBase Кодировки
| Наименование | Описание | Язык | Сервер? | ICU? | Байт/&zwsp;символ | Псевдонимы |
|---|---|---|---|---|---|---|
BIG5 | Big Five | Традиционный китайский | Нет | Нет | 1–2 | WIN950, Windows950 |
EUC_CN | Extended UNIX Code-CN | Упрощенный китайский | Да | Да | 1–3 | |
EUC_JP | Extended UNIX Code-JP | Японский | Да | Да | 1–3 | |
EUC_JIS_2004 | Extended UNIX Code-JP, JIS X 0213 | Японский | Да | Нет | 1–3 | |
EUC_KR | Extended UNIX Code-KR | Корейский | Да | Да | 1–3 | |
EUC_TW | Extended UNIX Code-TW | Традиционный китайский, тайваньский | Да | Да | 1–4 | |
GB18030 | Национальный стандарт | Китайский | Нет | Нет | 1–4 | |
GBK | Расширенный национальный стандарт | Упрощенный китайский | Нет | Нет | 1–2 | WIN936, Windows936 |
ISO_8859_5 | ISO 8859-5, ECMA 113 | Латиница/Кириллица | Да | Да | 1 | |
ISO_8859_6 | ISO 8859-6, ECMA 114 | Латиница/Арабский | Да | Да | 1 | |
ISO_8859_7 | ISO 8859-7, ECMA 118 | Латиница/Греческий язык | Да | Да | 1 | |
ISO_8859_8 | ISO 8859-8, ECMA 121 | Латиница/Иврит | Да | Да | 1 | |
JOHAB | JOHAB | Корейский (хангыль) | Нет | Нет | 1–3 | |
KOI8R | KOI8-R | Кириллица (русский язык) | Да | Да | 1 | KOI8 |
KOI8U | KOI8-U | Кириллица (украинский язык) | Да | Да | 1 | |
LATIN1 | ISO 8859-1, ECMA 94 | Западноевропейская | Да | Да | 1 | ISO88591 |
LATIN2 | ISO 8859-2, ECMA 94 | Центральноевропейская | Да | Да | 1 | ISO88592 |
LATIN3 | ISO 8859-3, ECMA 94 | Южноевропейская | Да | Да | 1 | ISO88593 |
LATIN4 | ISO 8859-4, ECMA 94 | Североевропейская | Да | Да | 1 | ISO88594 |
LATIN5 | ISO 8859-9, ECMA 128 | Турецкий | Да | Да | 1 | ISO88599 |
LATIN6 | ISO 8859-10, ECMA 144 | Скандинавский | Да | Да | 1 | ISO885910 |
LATIN7 | ISO 8859-13 | Балтийский | Да | Да | 1 | ISO885913 |
LATIN8 | ISO 8859-14 | Кельтский | Да | Да | 1 | ISO885914 |
LATIN9 | ISO 8859-15 | LATIN1 с символом евро и диакритическими знаками | Да | Да | 1 | ISO885915 |
LATIN10 | ISO 8859-16, ASRO SR 14111 | Румынский | Да | Нет | 1 | ISO885916 |
MULE_INTERNAL | Внутренний код Mule | Multilingual Emacs | Да | Нет | 1–4 | |
SJIS | Shift JIS | Японский | Нет | Нет | 1–2 | Mskanji, ShiftJIS, WIN932, Windows932 |
SHIFT_JIS_2004 | Shift JIS, JIS X 0213 | Японский | Нет | Нет | 1–2 | |
SQL_ASCII | не определено (см. текст) | любая | Да | Нет | 1 | |
UHC | Unified Hangul Code | Корейский | Нет | Нет | 1–2 | WIN949, Windows949 |
UTF8 | Юникод, 8 бит | all | Да | Да | 1–4 | Юникод |
WIN866 | Windows CP866 | Кириллица | Да | Да | 1 | ALT |
WIN874 | Windows CP874 | Тайский | Да | Нет | 1 | |
WIN1250 | Windows CP1250 | Центральноевропейская | Да | Да | 1 | |
WIN1251 | Windows CP1251 | Кириллица | Да | Да | 1 | WIN |
WIN1252 | Windows CP1252 | Западноевропейская | Да | Да | 1 | |
WIN1253 | Windows CP1253 | греческий язык | Да | Да | 1 | |
WIN1254 | Windows CP1254 | Турецкий | Да | Да | 1 | |
WIN1255 | Windows CP1255 | Иврит | Да | Да | 1 | |
WIN1256 | Windows CP1256 | Арабский язык | Да | Да | 1 | |
WIN1257 | Windows CP1257 | Балтийский | Да | Да | 1 | |
WIN1258 | Windows CP1258 | Вьетнамский язык | Да | Да | 1 | ABC, TCVN, TCVN5712, VSCII |
Не все клиентские APIподдерживают все перечисленные кодировки. Например,
Digital Q.DataBase
драйвер JDBC не поддерживает MULE_INTERNAL, LATIN6,
LATIN8и LATIN10.
Параметр SQL_ASCII работает значительно иначе, чем другие настройки. Когда кодировка сервера установлена как
SQL_ASCII, сервер интерпретирует значения байтов 0–127 в соответствии со стандартом ASCII, тогда как значения 128–255 воспринимаются как неинтерпретируемые символы. Преобразование кодировки не будет выполняться, если
выбран параметр SQL_ASCII. Таким образом, эта настройка является не столько объявлением использования конкретной кодировки, сколько декларацией отсутствия сведений о ней. В большинстве случаев при работе с любыми данными, отличными от ASCII, не рекомендуется использовать параметр
SQL_ASCII поскольку
Digital Q.DataBase не сможет обеспечить преобразование или валидацию символов, не входящих в набор ASCII.
initdb определяет кодировку по умолчанию (набор символов)
для Digital Q.DataBase кластера. Например,
initdb -E EUC_JP
устанавливает кодировку по умолчанию
EUC_JP (Extended Unix Code для японского языка). Вы
можете использовать параметр --encoding вместо
-E если предпочитаете полные имена параметров.
Если параметр -E или --encoding указан параметр, initdb пытается определить подходящую кодировку на основе указанной или используемой по умолчанию локали.
Вы можете указать кодировку, отличную от значения по умолчанию, при создании базы данных, при условии, что она совместима с выбранной локалью:
createdb -E EUC_KR -T template0 --lc-collate=ko_KR.euckr --lc-ctype=ko_KR.euckr korean
Будет создана база данных с именем korean использующая
кодировку EUC_KR, а также локаль ko_KR.
Другой способ выполнить эту операцию — использовать следующую SQL-команду:
CREATE DATABASE korean WITH ENCODING 'EUC_KR' LC_COLLATE='ko_KR.euckr' LC_CTYPE='ko_KR.euckr' TEMPLATE=template0;
Обратите внимание, что приведенные выше команды указывают на копирование базы данных template0
database. При копировании любой другой базы данных параметры кодировки и локали не могут отличаться от настроек исходной базы данных, так как это может привести к повреждению данных. Для получения дополнительной информации см.
Раздел 3.7.3.
Кодировка базы данных хранится в системном каталоге
pg_database. Ее можно просмотреть, используя параметр
psql -l или команду
\l command.
$ psql -l
Список баз данных
Имя | Владелец | Кодировка | Правила сортировки | Тип символов | Права доступа
-----------+----------+-----------+-------------+-------------+-------------------------------------
clocaledb | hlinnaka | SQL_ASCII | C | C |
englishdb | hlinnaka | UTF8 | en_GB.UTF8 | en_GB.UTF8 |
japanese | hlinnaka | UTF8 | ja_JP.UTF8 | ja_JP.UTF8 |
korean | hlinnaka | EUC_KR | ko_KR.euckr | ko_KR.euckr |
postgres | hlinnaka | UTF8 | fi_FI.UTF8 | fi_FI.UTF8 |
template0 | hlinnaka | UTF8 | fi_FI.UTF8 | fi_FI.UTF8 | {=c/hlinnaka,hlinnaka=CTc/hlinnaka}
template1 | hlinnaka | UTF8 | fi_FI.UTF8 | fi_FI.UTF8 | {=c/hlinnaka,hlinnaka=CTc/hlinnaka}
(7 строк)
В большинстве современных операционных систем Digital Q.DataBase
может определить, какая кодировка подразумевается параметром LC_CTYPE
и обеспечит использование только соответствующей кодировки базы данных. В устаревших системах пользователь несет ответственность за использование кодировки, соответствующей выбранной локали. Ошибка в этом аспекте может привести к некорректному выполнению операций, зависящих от локали, таких как сортировка.
Digital Q.DataBase позволит суперпользователям создавать
базы данных с SQL_ASCII кодировкой, даже если
LC_CTYPE не является C или POSIX. Как указано
выше, SQL_ASCII не гарантирует, что данные, хранящиеся в базе данных, используют определенную кодировку, поэтому такой выбор сопряжен с риском некорректной работы функций, зависящих от локали. Использование такой комбинации настроек не рекомендуется и в будущем может быть полностью запрещено.
Digital Q.DataBase поддерживает автоматическое преобразование наборов символов между сервером и клиентом для многих комбинаций кодировок (Раздел 3.8.3.4 показывает, каких именно).
Чтобы включить автоматическое преобразование кодировок, необходимо указать Digital Q.DataBase кодировку (encoding), которую требуется использовать на стороне клиента. Существует несколько способов реализации данной задачи:
Использование \encoding команды в
psql.
\encoding позволяет изменять клиентскую
кодировку динамически. Например,
для смены кодировки на SJIS, введите:
\encoding SJIS
libpq (Раздел 4.1.11) содержит функции для управления клиентской кодировкой.
Использование SET client_encoding TO.
Установка клиентской кодировки может быть выполнена с помощью следующей SQL-команды:
SET CLIENT_ENCODING TO '«ключ-значение»';
Также можно использовать стандартный синтаксис SQL SET NAMES
для этой цели:
SET NAMES '«ключ-значение»';
Для получения текущей кодировки клиента:
SHOW client_encoding;
Для возврата к кодировке по умолчанию:
RESET client_encoding;
Использование PGCLIENTENCODING. Если переменная окружения
PGCLIENTENCODING определена в окружении
клиента, эта клиентская кодировка выбирается автоматически
при установке соединения с сервером. (Впоследствии это значение
может быть переопределено любым из других методов,
упомянутых выше.)
С помощью переменной конфигурации client_encoding. Если эта
client_encoding переменная установлена, данная клиентская
кодировка выбирается автоматически при установке соединения с
сервер создан. (В дальнейшем это значение можно переопределить с помощью любого
из других методов, упомянутых выше.)
Если преобразование конкретного символа невозможно
— например, если выбрана кодировка EUC_JP для
сервера и LATIN1 для клиента, при этом возвращаются некоторые японские символы, для которых отсутствует представление в
LATIN1 — будет выдана ошибка.
Если кодировка клиента определена как SQL_ASCII, преобразование кодировок отключается независимо от кодировки сервера. (Однако, если кодировка сервера не SQL_ASCII, сервер все равно будет проверять,
что входящие данные корректны для этой кодировки; таким образом, итоговый результат будет аналогичен случаю, когда кодировка клиента совпадает с кодировкой сервера.) Как и для сервера, использование SQL_ASCII не рекомендуется,
за исключением случаев работы исключительно с данными в кодировке ASCII.
Digital Q.DataBase позволяет выполнять преобразование между любыми двумя кодировками, для которых функция преобразования указана в
pg_conversion
системный каталог. Digital Q.DataBase поставляется с
рядом предопределенных преобразований, краткая информация о которых приведена в
Таблица 3.8.4 и более подробно
описана в Таблица 3.8.5. Для создания
нового преобразования используйте SQL-команду
CREATE CONVERSION. (Для автоматического использования при
клиент-серверных преобразованиях оно должно быть помечено
как «правила сортировки по умолчанию» для данной пары кодировок.)
Таблица 3.8.4. Встроенные клиент-серверные преобразования кодировок
| Кодировка сервера | Доступные кодировки клиента |
|---|---|
BIG5 | не поддерживается в качестве серверной кодировки |
EUC_CN | EUC_CN,
MULE_INTERNAL,
UTF8
|
EUC_JP | EUC_JP,
MULE_INTERNAL,
SJIS,
UTF8
|
EUC_JIS_2004 | EUC_JIS_2004,
SHIFT_JIS_2004,
UTF8
|
EUC_KR | EUC_KR,
MULE_INTERNAL,
UTF8
|
EUC_TW | EUC_TW,
BIG5,
MULE_INTERNAL,
UTF8
|
GB18030 | не поддерживается в качестве серверной кодировки |
GBK | не поддерживается в качестве серверной кодировки |
ISO_8859_5 | ISO_8859_5,
KOI8R,
MULE_INTERNAL,
UTF8,
WIN866,
WIN1251
|
ISO_8859_6 | ISO_8859_6,
UTF8
|
ISO_8859_7 | ISO_8859_7,
UTF8
|
ISO_8859_8 | ISO_8859_8,
UTF8
|
JOHAB | не поддерживается в качестве серверной кодировки |
KOI8R | KOI8R,
ISO_8859_5,
MULE_INTERNAL,
UTF8,
WIN866,
WIN1251
|
KOI8U | KOI8U,
UTF8
|
LATIN1 | LATIN1,
MULE_INTERNAL,
UTF8
|
LATIN2 | LATIN2,
MULE_INTERNAL,
UTF8,
WIN1250
|
LATIN3 | LATIN3,
MULE_INTERNAL,
UTF8
|
LATIN4 | LATIN4,
MULE_INTERNAL,
UTF8
|
LATIN5 | LATIN5,
UTF8
|
LATIN6 | LATIN6,
UTF8
|
LATIN7 | LATIN7,
UTF8
|
LATIN8 | LATIN8,
UTF8
|
LATIN9 | LATIN9,
UTF8
|
LATIN10 | LATIN10,
UTF8
|
MULE_INTERNAL | MULE_INTERNAL,
BIG5,
EUC_CN,
EUC_JP,
EUC_KR,
EUC_TW,
ISO_8859_5,
KOI8R,
LATIN1 в команде LATIN4,
SJIS,
WIN866,
WIN1250,
WIN1251
|
SJIS | не поддерживается в качестве серверной кодировки |
SHIFT_JIS_2004 | не поддерживается в качестве серверной кодировки |
SQL_ASCII | any (преобразование не выполняется) |
UHC | не поддерживается в качестве серверной кодировки |
UTF8 | все поддерживаемые кодировки |
WIN866 | WIN866,
ISO_8859_5,
KOI8R,
MULE_INTERNAL,
UTF8,
WIN1251
|
WIN874 | WIN874,
UTF8
|
WIN1250 | WIN1250,
LATIN2,
MULE_INTERNAL,
UTF8
|
WIN1251 | WIN1251,
ISO_8859_5,
KOI8R,
MULE_INTERNAL,
UTF8,
WIN866
|
WIN1252 | WIN1252,
UTF8
|
WIN1253 | WIN1253,
UTF8
|
WIN1254 | WIN1254,
UTF8
|
WIN1255 | WIN1255,
UTF8
|
WIN1256 | WIN1256,
UTF8
|
WIN1257 | WIN1257,
UTF8
|
WIN1258 | WIN1258,
UTF8
|
Таблица 3.8.5. Все встроенные преобразования кодировок
| Имя преобразования [a] | Исходная кодировка | Целевая кодировка |
|---|---|---|
big5_to_euc_tw | BIG5 | EUC_TW |
big5_to_mic | BIG5 | MULE_INTERNAL |
big5_to_utf8 | BIG5 | UTF8 |
euc_cn_to_mic | EUC_CN | MULE_INTERNAL |
euc_cn_to_utf8 | EUC_CN | UTF8 |
euc_jp_to_mic | EUC_JP | MULE_INTERNAL |
euc_jp_to_sjis | EUC_JP | SJIS |
euc_jp_to_utf8 | EUC_JP | UTF8 |
euc_kr_to_mic | EUC_KR | MULE_INTERNAL |
euc_kr_to_utf8 | EUC_KR | UTF8 |
euc_tw_to_big5 | EUC_TW | BIG5 |
euc_tw_to_mic | EUC_TW | MULE_INTERNAL |
euc_tw_to_utf8 | EUC_TW | UTF8 |
gb18030_to_utf8 | GB18030 | UTF8 |
gbk_to_utf8 | GBK | UTF8 |
iso_8859_10_to_utf8 | LATIN6 | UTF8 |
iso_8859_13_to_utf8 | LATIN7 | UTF8 |
iso_8859_14_to_utf8 | LATIN8 | UTF8 |
iso_8859_15_to_utf8 | LATIN9 | UTF8 |
iso_8859_16_to_utf8 | LATIN10 | UTF8 |
iso_8859_1_to_mic | LATIN1 | MULE_INTERNAL |
iso_8859_1_to_utf8 | LATIN1 | UTF8 |
iso_8859_2_to_mic | LATIN2 | MULE_INTERNAL |
iso_8859_2_to_utf8 | LATIN2 | UTF8 |
iso_8859_2_to_windows_1250 | LATIN2 | WIN1250 |
iso_8859_3_to_mic | LATIN3 | MULE_INTERNAL |
iso_8859_3_to_utf8 | LATIN3 | UTF8 |
iso_8859_4_to_mic | LATIN4 | MULE_INTERNAL |
iso_8859_4_to_utf8 | LATIN4 | UTF8 |
iso_8859_5_to_koi8_r | ISO_8859_5 | KOI8R |
iso_8859_5_to_mic | ISO_8859_5 | MULE_INTERNAL |
iso_8859_5_to_utf8 | ISO_8859_5 | UTF8 |
iso_8859_5_to_windows_1251 | ISO_8859_5 | WIN1251 |
iso_8859_5_to_windows_866 | ISO_8859_5 | WIN866 |
iso_8859_6_to_utf8 | ISO_8859_6 | UTF8 |
iso_8859_7_to_utf8 | ISO_8859_7 | UTF8 |
iso_8859_8_to_utf8 | ISO_8859_8 | UTF8 |
iso_8859_9_to_utf8 | LATIN5 | UTF8 |
johab_to_utf8 | JOHAB | UTF8 |
koi8_r_to_iso_8859_5 | KOI8R | ISO_8859_5 |
koi8_r_to_mic | KOI8R | MULE_INTERNAL |
koi8_r_to_utf8 | KOI8R | UTF8 |
koi8_r_to_windows_1251 | KOI8R | WIN1251 |
koi8_r_to_windows_866 | KOI8R | WIN866 |
koi8_u_to_utf8 | KOI8U | UTF8 |
mic_to_big5 | MULE_INTERNAL | BIG5 |
mic_to_euc_cn | MULE_INTERNAL | EUC_CN |
mic_to_euc_jp | MULE_INTERNAL | EUC_JP |
mic_to_euc_kr | MULE_INTERNAL | EUC_KR |
mic_to_euc_tw | MULE_INTERNAL | EUC_TW |
mic_to_iso_8859_1 | MULE_INTERNAL | LATIN1 |
mic_to_iso_8859_2 | MULE_INTERNAL | LATIN2 |
mic_to_iso_8859_3 | MULE_INTERNAL | LATIN3 |
mic_to_iso_8859_4 | MULE_INTERNAL | LATIN4 |
mic_to_iso_8859_5 | MULE_INTERNAL | ISO_8859_5 |
mic_to_koi8_r | MULE_INTERNAL | KOI8R |
mic_to_sjis | MULE_INTERNAL | SJIS |
mic_to_windows_1250 | MULE_INTERNAL | WIN1250 |
mic_to_windows_1251 | MULE_INTERNAL | WIN1251 |
mic_to_windows_866 | MULE_INTERNAL | WIN866 |
sjis_to_euc_jp | SJIS | EUC_JP |
sjis_to_mic | SJIS | MULE_INTERNAL |
sjis_to_utf8 | SJIS | UTF8 |
windows_1258_to_utf8 | WIN1258 | UTF8 |
uhc_to_utf8 | UHC | UTF8 |
utf8_to_big5 | UTF8 | BIG5 |
utf8_to_euc_cn | UTF8 | EUC_CN |
utf8_to_euc_jp | UTF8 | EUC_JP |
utf8_to_euc_kr | UTF8 | EUC_KR |
utf8_to_euc_tw | UTF8 | EUC_TW |
utf8_to_gb18030 | UTF8 | GB18030 |
utf8_to_gbk | UTF8 | GBK |
utf8_to_iso_8859_1 | UTF8 | LATIN1 |
utf8_to_iso_8859_10 | UTF8 | LATIN6 |
utf8_to_iso_8859_13 | UTF8 | LATIN7 |
utf8_to_iso_8859_14 | UTF8 | LATIN8 |
utf8_to_iso_8859_15 | UTF8 | LATIN9 |
utf8_to_iso_8859_16 | UTF8 | LATIN10 |
utf8_to_iso_8859_2 | UTF8 | LATIN2 |
utf8_to_iso_8859_3 | UTF8 | LATIN3 |
utf8_to_iso_8859_4 | UTF8 | LATIN4 |
utf8_to_iso_8859_5 | UTF8 | ISO_8859_5 |
utf8_to_iso_8859_6 | UTF8 | ISO_8859_6 |
utf8_to_iso_8859_7 | UTF8 | ISO_8859_7 |
utf8_to_iso_8859_8 | UTF8 | ISO_8859_8 |
utf8_to_iso_8859_9 | UTF8 | LATIN5 |
utf8_to_johab | UTF8 | JOHAB |
utf8_to_koi8_r | UTF8 | KOI8R |
utf8_to_koi8_u | UTF8 | KOI8U |
utf8_to_sjis | UTF8 | SJIS |
utf8_to_windows_1258 | UTF8 | WIN1258 |
utf8_to_uhc | UTF8 | UHC |
utf8_to_windows_1250 | UTF8 | WIN1250 |
utf8_to_windows_1251 | UTF8 | WIN1251 |
utf8_to_windows_1252 | UTF8 | WIN1252 |
utf8_to_windows_1253 | UTF8 | WIN1253 |
utf8_to_windows_1254 | UTF8 | WIN1254 |
utf8_to_windows_1255 | UTF8 | WIN1255 |
utf8_to_windows_1256 | UTF8 | WIN1256 |
utf8_to_windows_1257 | UTF8 | WIN1257 |
utf8_to_windows_866 | UTF8 | WIN866 |
utf8_to_windows_874 | UTF8 | WIN874 |
windows_1250_to_iso_8859_2 | WIN1250 | LATIN2 |
windows_1250_to_mic | WIN1250 | MULE_INTERNAL |
windows_1250_to_utf8 | WIN1250 | UTF8 |
windows_1251_to_iso_8859_5 | WIN1251 | ISO_8859_5 |
windows_1251_to_koi8_r | WIN1251 | KOI8R |
windows_1251_to_mic | WIN1251 | MULE_INTERNAL |
windows_1251_to_utf8 | WIN1251 | UTF8 |
windows_1251_to_windows_866 | WIN1251 | WIN866 |
windows_1252_to_utf8 | WIN1252 | UTF8 |
windows_1256_to_utf8 | WIN1256 | UTF8 |
windows_866_to_iso_8859_5 | WIN866 | ISO_8859_5 |
windows_866_to_koi8_r | WIN866 | KOI8R |
windows_866_to_mic | WIN866 | MULE_INTERNAL |
windows_866_to_utf8 | WIN866 | UTF8 |
windows_866_to_windows_1251 | WIN866 | WIN |
windows_874_to_utf8 | WIN874 | UTF8 |
euc_jis_2004_to_utf8 | EUC_JIS_2004 | UTF8 |
utf8_to_euc_jis_2004 | UTF8 | EUC_JIS_2004 |
shift_jis_2004_to_utf8 | SHIFT_JIS_2004 | UTF8 |
utf8_to_shift_jis_2004 | UTF8 | SHIFT_JIS_2004 |
euc_jis_2004_to_shift_jis_2004 | EUC_JIS_2004 | SHIFT_JIS_2004 |
shift_jis_2004_to_euc_jis_2004 | SHIFT_JIS_2004 | EUC_JIS_2004 |
[a]
Имена преобразований следуют стандартной схеме именования:
официальное название исходной кодировки, в котором все
не буквенно-цифровые символы заменены подчеркиваниями, за которыми
следует | ||
Данные источники рекомендуются для начала ознакомления с различными системами кодирования.
Содержит подробные описания EUC_JP,
EUC_CN, EUC_KR,
EUC_TW.
Веб-сайт Консорциума Юникода (Unicode Consortium).
UTF-8 (8-битный формат преобразования UCS/Юникода) определен в данном документе.