- 完善Qwen3.5 MTP解码,支持多卡、批量和非贪婪采样,支持FP8草稿头
- 优化Qwen3.5 MTP验证转置和单请求草稿调度,修复状态提交、批量全接受、长输入、前缀缓存命中及显存溢出问题
- 优化Qwen3.5 MoE和TP2归约及CUDA Graph资源使用,修复TP多模态前向和非CUDA编译问题
- 新增FP8 Linear加速路径并内置所需头文件,优化FP8算子变体选择、输入量化缩放、权重缓存及小批量回退
- 优化Qwen3 FP8 MLP融合路径
- 完善auto模式下的FP8权重识别、NVFP4权重加载及多卡切分,优化NVFP4单Token GEMV,修复FP8多卡缩放因子切分
- 支持OpenAI Responses API
- API server支持
--max_context_length限制单会话上下文,并在/v1/models返回模型、KV Cache及实际上下文容量 - 完善工具调用解析和流式、非流式校验,支持tool_choice、strict参数校验以及工具名和参数名生成约束
- 修复多种工具流解析状态及聊天结束原因,补充DeepSeek V4等工具调用回归和手动测试
- 修复think模式下KV Cache复用失败,以及CPU Qwen3数据类型、重复输出和乱码问题
- 修复分页缓存越界写入,调整分页缓存调度容量和预热采样页预算
- 修复CUDA Graph错误熔断、MultiCUDA大权重偏移溢出和CUDA多卡内存释放死锁,完善CUDA执行同步及多Token状态快照
- 补充CUDA多卡、状态快照和算子数值回归测试,以及FP8算子基准和算子开发支持
- 新增终端部署向导和模型向导(ftllm即可执行)
- 优化张量并行
- 初步支持Qwen3.5 MTP解码
- 支持Qwen3.5 MoE路径,修复Qwen3MoE异构TP及混合MoE设备路径
- 修复Qwen3.5前缀缓存、空注意力分片和非CUDA编译问题
- 支持Step3.7文本模型、视觉前向和多模态预处理
- 初步支持CUDA Graph
- 支持MoE混合推理的层数
- 优化多卡按层切分平衡,修复多卡分页缓存分配和分页调度饿死问题
- 支持SM60, SM70
- 修复Qwen工具调用解析、cuBLAS句柄表并发竞争、CUDA分页注意力崩溃、分页缓存元数据及页数统计等问题
- 修复logits结果生命周期和潜在内存泄漏问题
- 更新混合推理文档
- 优化DeepSeek V4解码速度
- 优化DeepSeek V4预填重速度
- 优化DeepSeek V4并发速度
- 优化DeepSeek V4 NVFP4算子的速度
- DeepSeek V4模型支持多卡串行
- 减少NVFP4模型的内存占用
- 优化CUDA MOE速度
- 支持多CUDA, NUMA, Disk一起混合推理
- 支持Step3.5模型,补充Step3.5运行时和服务适配,优化Step3.5 MoE拆分与并发解码
- 优化Qwen3.5批量解码吞吐
- 修复transformers 5.8.0升级后不兼容的bug
- 增加
--cuda_slab参数,可减少大量CUDA模型权重小块分配造成的显存碎片
- 支持磁盘MoE推理,补充磁盘设备后端和SSD读取速度测试工具
- 优化GGUF磁盘MoE推理,修复磁盘MoE及FP8磁盘MoE加载问题
- 支持DeepSeek V4思考输出, 可以使用参数--enable_thinking控制
- 优化DeepSeek V4显存缓存拼接,修复解码缓存内存增长问题
- 限制DeepSeek V4稀疏预填充临时显存,降低长上下文预填充显存峰值
- 调整DeepSeek V4默认采样参数,默认使用top_k = 5
- 更新DeepSeek V4量化配置,补充Q2、Q4、UD-Q2_K_L、UD-Q2_K_M量化示例
- 支持CUDA NVFP4线性计算
- 支持CUDA Q2_K_R4反量化
- 优化DeepSeek V4 compressedKV CUDA缓存,提升稀疏解码性能
- 支持DeepSeek V4模型,补充DeepSeek V4的分词和chat_template处理
- 修复DeepSeek V4缺少chat_template时加载出错的问题
- 修复DeepSeek V4工具调用解析的问题
- 支持Qwen3.5多模态推理,补充Qwen3.5多模态Python接口
- 支持Qwen3.5 MoE模型识别和默认参数设置
- 初步支持Gemma4多模态推理
- 支持Minimax-M2模型,补充Minimax-M2工具调用解析
- 初步支持Anthropic API兼容接口,新增
/v1/messages接口 - 修复Anthropic API工具调用的问题
- OpenAI兼容API支持图文输入,支持http、data url和file url图片
- 修复多模态推理资源管理的问题
- 支持参数
--kv_cache_dtype设置KV缓存类型 - 增加
--chunked_prefill_size参数设置分块prefill大小 - 增加
--tokens、--page_size、--gpu_mem_ratio等参数,方便控制长上下文和缓存 - 增加
--moe_atype参数,可指定MOE层激活类型 - 增加
--cuda_se参数,可控制共享专家是否使用CUDA执行 - 支持
cudapp=N、cudapp=1:2:3形式简写多卡串行执行参数 - API server支持读取模型默认采样参数
- API server支持通过命令行覆盖temperature、top_p、top_k、repeat_penalty等采样参数
- 修复API server中enable_thinking和think参数透传的问题
- API server启动时会尝试提高ulimit,减少请求较多时文件描述符不足的问题
- 新增
ftllm.env模块,可读取当前wheel的编译信息 - 优化Python包版本读取,支持从
ftllm、ftllm-nightly、ftllm-rocm读取版本号 - 优化CUDA wheel依赖库加载,支持从pip安装的nvidia依赖中查找CUDA、cuBLAS、NCCL库
- CUDA wheel补充NCCL依赖和SM80预编译架构
- 修复Python历史缓存的问题
- 修复读取GGUF模型时未加载generation_config的问题
- 修复CPU embedding、tie weight等模型加载问题
- 修复tool parser在tokenizer缺失时可能出错的问题
- 修复nightly打包元数据和Python包编译脚本相关问题
- 初步支持AMX加速,在支持AMX的机器上通过参数--amx true来开启
- 修复纯CPU执行Next模型出错的bug
- 修复部分没有AVX512的机器执行出错的bug
- Numa分配出错时输出提示信息和解决命令
- 修复Cuda计算长Attention的错误 (pr from loveheart)
- 修复Arm上的编译
- 提高moe_device为numa时的prefill速度
- moe_device为numa时,可以不设置环境变量,通过
-t参数设置总的线程数 - 支持参数
--moe_dtype bfloat16指定moe类型为bf16, 在一些情况下可以提高速度 - 支持GLM系列的FP8模型,修复GLM模型长上下文的bug
- 支持DeepSeek V3.2模型
- 新增项目引用文件说明,详见参考代码和文章
- 修复Qwen3-Next长上下文中出现的bug
- 增加 通用动态量化(Universal Dynamic Quantization)功能,参考动态量化指南
- 修复Qwen3-Next缓存错误的Bug
- 提升Qwen3-Next混合推理速度
- 初步适配Qwen3-Next模型
- 修复GLM4.5出错的一些bug
- 支持一些GGUF类型
- 部分模型支持工具调用 查看详情
- 支持GLM4.5, GLM4.5-AIR
- 修复1.4.3版本部分模型缓存失效的bug
- DSV3.1支持使用enable_thinking打开思考模式
- Prefill时会发空包维持客户端连接
- 修复部分GGUF-q8模型计算出错的bug
- 修复部分fp16模型numa计算出错的bug
- 修复一些情况下前端退出后后端继续推理的问题
- 修复一些情况下crtl + c无法退出的问题
- 修复numa模式下推理GGUF出现的一些计算错误
- 增加GGUF中q8_0类型支持
- 修复AVX512模式下出错的问题
- 修复一些可能的glibc出错问题
- 适配部分GGUF模型
- 混合推理提升Prefill速度
- c++中增加了一些分词器
- 修复位置编码的一些bug
- 修改重复惩罚因子,当last_n为0时,重复惩罚与Transfromers一致
- 修复download可能出错的一些bug
- 修复Kimi-K2模型分词出现的一些错误
- 支持Kimi-K2模型
- 修复8numa时的一些bug
- 加速CPU上的AWQ计算
- 修复上个版本一些模型无法读取的bug
- 支持Hunyuan模型 (混元)
- 支持Ernie_4.5模型 (文心)
- 支持PanguPro模型 (盘古)
- 支持Minimax 01, Minimax M1模型
- 优化旧GPU上的一些计算性能
- 在dev_mode下支持主动终止请求 查看详情
- 修复numa模式下无法计算float16的问题
- 修复numa个数过多时可能出现的一些错误
- DeepSeek模型中,默认改用cuda执行共享专家,可通过参数
--cuda_se false来关闭 - 支持使用类似
--device "{'cuda:0':1,'cuda:1':1}"的命令来串行执行,参考如何设定运行设备 - 增加动态量化功能,参考动态量化指南
- 修复一些超长prompt可能引起的出错
- 多卡张量并行时将平分显存,目前测试阶段,仅在llama系模型(如Qwen2, Qwen2.5, QwQ等)生效
- 所有moe模型支持
--moe_expert参数 (之前的版本中,qwen3-moe此参数不会生效)
- 规范版本号 a.b.c.d
- a为保留位,目前为0
- b为大版本号
- c为小版本号
- d为bug修复版本的编号
- 优化了numa加速
- 略微提升了prefill和decode速度
- 支持了moe的混合张量并行,参考混合推理指南
- 修复了multicuda的一些bug,支持了所有精度的混合张量并行
- 修复了C++下Jinja模板的一些bug,支持Qwen3, DS等一系列模型的内置分词器
- 支持了
FP8_E4M3精度(新老硬件均可) - MOE模型支持用
--moe_dtype来设置混合精度 - 可以在
ROCM环境下使用pip安装了 - 修复了C++下Jinja模板的一些bug
- api server的默认输出token数由8K提升到32K
- 支持了千问3模型 部署指南
- 优化了DeepSeek模型的显存使用
- 增加参数
--cache_fast来指定是否使用显存缓存
- 优化了使用DeepSeek模型时的多轮对话缓存
- 略微提升了DeepSeek模型的多并发速度
- 减少了DeepSeek模型Prefill时的显存消耗,可以支持更长的上下文
- 支持了DeepSeek模型的INT8量化 (使用原始模型时
--dtype int8,或者导出时--dtype int8) - 隐藏了 "None of PyTorch, TensorFlow >= 2.0 ..." 的警告信息
- 增加了
--cache_dir参数来指定缓存目录 - server增加了
--hide_input参数来隐藏日志中的请求信息 - webui增加了
--max_token参数来指定最大输出,--think参数来强制思考
- api server增加api_key参数,来设定api_key
- api server支持了一些复合输入
- 提升了moe模型prefill的速度
- 增加了--version参数查看版本号
- 增加config选项,可通过config.json文件来启动模型
- 提升moe模型的速度
- 降低GLIBC版本,PIP安装包兼容更多系统
- PIP安装包支持更多架构(目前最低支持到SM_52)
- 修改文档,增加了一些pip安装后无法使用的情况说明
- 聊天模式下自动读取模型的生成配置文件
- 修复一些情况下kv_cache_limit计算错误的问题
- 增加ftllm run, chat, webui, server接口