Verified project record
kvcache-ai/ktransformers
ktransformers enables high-performance CPU-GPU heterogeneous computing for large language models, including MoE architectures, reducing hardware requirements for inference and fine-tuning. It provides kt-kernel serving with AMX/AVX acceleration and NUMA-aware memory management, and supports fine-tuning via LLaMA-Factory integration.