it's multimodal, see https://github.com/ggml-org/llama.cpp/blob/master/docs/multi...
Multimodal doesn't guarantee input and output.
> Currently, we support image, audio and video input.
Multimodal doesn't guarantee input and output.
> Currently, we support image, audio and video input.