chinese is less token efficient than english
How so? Do you mean in practice when using mostly english trained models?
How so? Do you mean in practice when using mostly english trained models?