AI产品库
LLaMA-Factory(hiyouga)Logo

品牌档案

LLaMA-Factory

零代码微调上百种大模型与多模态模型

官方把它概括为「统一、高效地微调上百个大语言模型与视觉语言模型」:既可以用图形界面点选完成训练,也可以用命令行与配置文件驱动,覆盖预训练、监督微调、奖励建模与多种偏好优化方法,并内置推理与部署通道。

深度介绍

LLaMA-Factory详细介绍

🖱

零代码:图形界面与命令行二选一

官方把它定位成「像说话一样简单地微调大模型」:内置基于 Gradio 的 LLaMA Board 图形界面,选模型、选数据集、调参数、开训、看日志都在页面上完成;同时也支持命令行与配置文件,适合把实验纳入版本管理与脚本化流水线。官方还提供一个在线体验空间,不装环境就能先摸清流程。两种方式共用同一套后端,因此界面上跑通的配置可以直接落到命令行复现。对刚开始接触微调的团队,这是把学习成本压到最低的一条路径。

🧠

训练方法:从预训练到偏好优化

官方集成的训练方法覆盖面很宽:连续预训练、监督微调(含多模态监督微调)、奖励建模,以及 PPO、DPO、KTO、ORPO 等强化学习与偏好优化路径。配合官方提供的示例数据集,可以先用小模型走完整个流程,再替换成真实数据与目标模型。这类框架的价值在于方法之间切换成本低——同一份数据与模型,换个训练阶段就能对比效果;需要注意不同方法对数据格式与显存的要求差别很大,偏好优化通常还需要成对的偏好数据,准备数据往往比调参更花时间。

💾

显存不够时的选择:LoRA 与多种量化

面向消费级与中小规模算力,官方支持 16 位全参微调、冻结微调、LoRA,以及 2/3/4/5/6/8 位的 QLoRA,量化后端涵盖 AQLM、AWQ、GPTQ、LLM.int8、HQQ 与 EETQ 等;此外还集成了 GaLore、BAdam、APOLLO、Adam-mini、Muon 等降低优化器显存的算法,以及 DoRA、LoRA+、LoftQ、PiSSA、LongLoRA 等 LoRA 变体与长上下文方案。实践路径通常是:先用 4 位量化加 LoRA 在单卡上跑通,再按效果与预算决定是否上全参或多卡。

🖼

多模态与多任务:图像、视频、音频

它不只是文本微调工具:官方列出的任务类型包括多轮对话、工具调用、图像理解、视觉定位、视频识别与音频理解等,模型侧覆盖 LLaMA、LLaVA、Mistral、Mixtral-MoE、Qwen3 与 Qwen3-VL、DeepSeek、Gemma、GLM、Phi 等系列。官方还维护一张「Day-N 支持」表,记录各前沿模型在发布后多久被支持(部分标注为 Day 0)。做多模态项目时,数据集的组织方式与文本微调差异较大,建议直接沿用官方示例的数据格式再替换素材,能省掉大量调试。

训练加速与实验监控

效率方面,官方集成了 FlashAttention-2、Unsloth、Liger Kernel 与 KTransformers 等加速方案,并支持 RoPE 缩放、NEFTune 与 rsLoRA 等实用技巧;实验监控可接 LlamaBoard 自身、TensorBoard、Weights & Biases、MLflow 与 SwanLab。这些选项的组合空间很大,容易陷入「调参陷阱」——更稳妥的做法是先固定一套能跑通的配置拿到基线,再逐项开启加速与技巧,每次只改一个变量并记录显存与吞吐变化,否则很难判断收益来自哪里。

🚀

训练完直接部署:vLLM 与 SGLang

框架内置了推理与部署通道:官方支持导出模型检查点(还能一并导出 Ollama 的模型描述文件),并提供 OpenAI 风格接口、Gradio 界面与命令行三种推理方式,后端可选用 vLLM 或 SGLang 加速。对做内部服务的团队,这条链路省去了「训练完还要另找推理框架适配」的步骤;不过导出格式与推理后端之间存在匹配关系(例如量化格式与合并方式),上线前建议先用目标后端做一轮完整回归,确认输出与训练时一致。

🧩

安装方式与算力平台

官方提供 PyPI 包与 Docker 镜像两条安装路径,并给出 Colab 免费笔记本、国内云平台的试用环境,以及针对 AMD GPU 与昇腾 NPU 的专门文档;模型与数据集还可从 ModelScope、Modelers 等国内源下载,对网络受限的环境比较友好。这意味着从笔记本试跑到集群训练都能找到对应的起步方式。需要注意的是不同安装方式对应的依赖版本组合不同,尤其是量化后端与加速库,建议在固定镜像里做实验,避免环境漂移导致结果不可复现。

📌

采用情况与官网提醒

官方 README 提到框架被多家公司使用,并链接了相应的技术文章;项目源自 ACL 2024 论文,核验时仓库约有 7.5 万 star,采用 Apache-2.0 许可。另有一条值得留意的提醒:官方在 README 中明确说明除其列出的官方链接之外,其他网站均为未经授权的第三方网站,请谨慎使用——搜索安装包与镜像时认准官方仓库、PyPI 与官方文档入口。版本方面,发布页最新记录为 v0.9.5(2025 年 12 月 31 日),README 内的更新记录也集中在 2025 年,选用前建议确认项目当前维护节奏。

产品特点

核心功能与独有价值

01

零代码 WebUI 与命令行共用一套后端

内置基于 Gradio 的 LLaMA Board,选模型、配数据、开训与看日志都在页面上完成;同一套配置也能落到命令行复现,并提供在线体验空间供人先试后装。

02

训练方法与方法变体覆盖极广

集成了预训练、监督微调、奖励建模与 PPO、DPO、KTO、ORPO,并支持 16 位全参、冻结、LoRA 与 2 至 8 位 QLoRA(含 AQLM、AWQ、GPTQ、HQQ、EETQ 等后端),以及 GaLore、BAdam、Muon 等省显存算法。

03

多模态与多任务:图像、视频、音频与工具调用

任务类型覆盖多轮对话、工具调用、图像理解、视觉定位、视频识别与音频理解,模型侧包含 LLaMA、LLaVA、Qwen3/Qwen3-VL、DeepSeek、Gemma、GLM、Mixtral-MoE 等系列。

04

训练与部署在同一条链路里

支持导出检查点与 Ollama 模型文件,并可用 vLLM 或 SGLang 作为推理后端,提供 OpenAI 风格接口、Gradio 界面与命令行三种调用方式,减少训练到上线之间的工具切换。

最近动态

重要更新

v0.9.5:跟进新模型与新版 Transformers

发布页记录 v0.9.5 于 2025 年 12 月 31 日发布,标题标注了对 Qwen3.5/3.6、Gemma 4 与 Transformers v5 的支持。此前 v0.9.3(2025 年 5 月 20 日)的标题为 Llama4、Gemma3、Qwen3、InternVL3 与 Qwen2.5-Omni 支持。

加入 Megatron-core 训练后端

2025 年 10 月 26 日官方在更新记录中宣布支持 Megatron-core 训练后端(通过 mcore_adapter 项目接入),为大规模训练提供了另一种并行后端选择。具体用法以官方文档与对应 PR 说明为准。

OFT 系列算法与新模型支持

2025 年 8 月官方先后加入 OFT 与 OFTv2 两种正交微调方法、对 Intern-S1-mini 的支持,以及对该月新发布的开源权重模型 GPT-OSS 的微调支持。这些条目反映了项目对「新模型发布后尽快可微调」的跟进策略。

Qwen3 系列与多种优化器、新模型集中落地

2025 年 4 月官方集中支持了 Qwen3 模型族、InternVL3、GLM-Z1 与 Kimi-VL、Llama 4 等模型,并加入 Muon 优化器;同期还持续补充了多模态与长上下文相关能力。核验时 README 的更新记录止于 2025 年 10 月,后续变化请以官方仓库与文档为准。

产品总结

LLaMA-Factory 是 hiyouga 与社区维护的开源微调框架,官方定位是「统一、高效地微调上百个大语言模型与视觉语言模型」,相关论文发表于 ACL 2024。项目以 Apache-2.0 许可开源,核验时 GitHub 仓库约有 7.5 万 star,发布页最新版本记录为 v0.9.5(2025 年 12 月 31 日,标题标注支持 Qwen3.5/3.6、Gemma 4 与 Transformers v5),README 内的更新记录也集中在 2025 年,选用前建议确认项目的当前维护节奏。 它最大的特点是门槛低:内置基于 Gradio 的 LLaMA Board 图形界面,选模型、配数据集、调参数、开训与查看日志都能在页面上完成,官方还提供一个在线体验空间;同时也支持命令行与配置文件,两者共用同一套后端,界面上的配置可以直接落成脚本。训练方法覆盖连续预训练、监督微调(含多模态)、奖励建模以及 PPO、DPO、KTO、ORPO 等偏好优化路径,并随官方示例数据集提供可复现的起步样例。 资源受限时的选项也比较全:支持 16 位全参微调、冻结微调、LoRA,以及 2 至 8 位的 QLoRA,量化后端包括 AQLM、AWQ、GPTQ、LLM.int8、HQQ 与 EETQ 等;另有 GaLore、BAdam、APOLLO、Adam-mini、Muon 等降低优化器显存的算法,以及 DoRA、LoRA+、LoftQ、PiSSA、LongLoRA 等 LoRA 变体。效率侧集成 FlashAttention-2、Unsloth、Liger Kernel 与 KTransformers,并可接 TensorBoard、Weights & Biases、MLflow 与 SwanLab 做实验追踪。任务类型覆盖多轮对话、工具调用、图像理解、视觉定位、视频识别与音频理解,模型侧包含 LLaMA、LLaVA、Mistral、Mixtral-MoE、Qwen3 与 Qwen3-VL、DeepSeek、Gemma、GLM、Phi 等系列。 训练之后可以直接走到部署:官方支持导出模型检查点与 Ollama 模型文件,提供 OpenAI 风格接口、Gradio 界面与命令行三种推理方式,并可选用 vLLM 或 SGLang 作为后端。安装方式包括 PyPI 包与 Docker 镜像,另有 Colab 笔记本、国内云平台试用环境以及 AMD GPU 与昇腾 NPU 的专门文档,模型与数据集也能从国内源下载。使用前需要注意:官方在 README 中明确提醒除其列出的官方链接外,其他网站均为未经授权的第三方网站,下载与安装请认准官方渠道;不同训练方法与量化后端的组合对显存与数据格式要求差异较大;训练到上线的链路虽已打通,仍建议用目标推理后端做一次完整回归。

产品类型
大模型微调框架与工具链
支持平台
内置 WebUI(LLaMA Board,基于 / 命令行与配置文件 / PyPI 安装(llamafactory) / Docker 镜像 / Colab 与云端笔记本 / Hugging Face Spaces / ModelScope 创空间 / AMD GPU 与昇腾 NPU 后端
资费模式
Apache-2.0 许可免费开源;成本来自自备或租用的 GPU 算力。

核验信息

参考文章与数据来源

本页事实来自 LLaMA-Factory 官方渠道:GitHub 仓库 README(「统一高效微调上百个模型」定位与 ACL 2024 标注、功能清单中的模型系列、训练方法、参数高效与量化方案、高级算法与实用技巧、任务类型、实验监控与推理后端、Day-N 支持表、安装与云端试用入口、Docker 与文档链接,以及「除官方链接外均为未授权第三方网站」的提醒)与许可文件(Apache-2.0)、发布页版本与日期、README 内按月记录的更新条目,以及官方文档站与官方博客。star 数与版本核验于 2026 年 9 月 22 日;项目更新记录集中在 2025 年,请以官方仓库当期状态为准。

  1. 其他LLaMA-Factory 官方仓库
  2. 官方文档官方文档(Read the Docs)
  3. 官方文档官方文档 · 昇腾 NPU 后端
  4. 其他在线体验空间 LLaMA Board
  5. 其他ModelScope 创空间
  6. 其他官方 PyPI 包
  7. 其他官方博客
  8. 其他官方版本发布页

用户体验调查

LLaMA-Factory介绍页面对您是否有帮助?