Pull to refresh
6
3
Subscribers
Send message

Насколько я пониманию, иероглифов слишком много, поэтому в двоичном коде один иероглиф обычно представляется как несколько байтов. Отсюда можно применить алгоритмы типа byte-level BPE (тот же BPE, только вместо начальной инициализации отдельными символами, инициализируются байты). В итоге один иероглиф может представляться несколькими токенами.

Не уверен, насколько это будет практично. LLM ведь в любом случае "мыслят" в рамках латентного пространства токенов, которое при применении одного и того же токенизатора будет одинаковым. Но звучит интересно.

Information

Rating
Does not participate
Registered
Activity