最近想在公司一台只有CPU的旧服务器上跑一个7B的对话模型(Qwen2.5-7B),用transformers和llama.cpp都试了一遍。transformers加载模型就花了快10分钟,生成一个“你好”都要半分钟;换成llama.cpp的Q4量化后稍微好点,但生成速度还是不到2 token/s。服务器是48核的Xeon和128G内存,应该也不算太差吧?请问这种场景下有没有什么加速技巧?比如用ONNX Runtime或者Intel的扩展库会不会有大提升?或者只能老老实实上GPU了?先谢过各位大佬。