docs/cn/run/cli/quickstart.mdx
import Feedback from "/snippets/page-feedback.mdx";
qairt(Qualcomm AI Engine Direct)用于 Qualcomm AI Hub 模型,llama_cpp 用于任意 GGUF。语言模型:
geniex infer ai-hub-models/Qwen3-4B
多模态模型:
geniex infer ai-hub-models/Qwen2.5-VL-7B-Instruct
系统提示时请选择 Q4_0——它在 Hexagon NPU 上支持最佳。
语言模型:
geniex infer unsloth/Qwen3.5-0.8B-GGUF
多模态模型:
geniex infer Qwen/Qwen3-VL-2B-Instruct-GGUF
系统提示时请选择:
vlm,纯文本模型选 llm。Qwen3.5 与 Gemma4 目前请选 llm(多模态支持即将推出)。Q4_0 在 Hexagon NPU 上性能最佳。<Tip>如需尝试其他 GGUF 模型,从 Hugging Face 复制任意兼容 GGUF 路径替换上面的命令即可。详见运行 Hugging Face 上的 GGUF 模型。</Tip>
已有模型文件在本地,或想从 Hugging Face 自行转换模型包?使用 geniex pull 配合 --local-path 注册到缓存,然后像其他模型一样运行。详见:
.zip。.gguf 文件的目录。