Llama 4 对个人开发者最容易造成的误会,是型号里的“17B”。Scout 和 Maverick 每处理一个 token 大约激活 170 亿参数,但完整权重分别远大于 170 亿。能运行多少参数与要下载、存储多少权重,是两回事。
本文截至 2026 年 8 月 30 日,根据 Meta 官方模型仓库与 Hugging Face 文档梳理。Llama 4 于 2025 年 4 月发布,接入前仍应检查模型卡、许可和框架的当前版本。
## 先认识 Scout 与 Maverick
Llama 4 是原生多模态的混合专家模型,文本与图像从较早阶段共同进入模型,而不是把一个独立视觉模型简单接在语言模型后面。
Scout 有 16 个专家,总参数约 1090 亿,每个 token 激活约 170 亿;指令版官方上下文上限为 1000 万 token。Maverick 有 128 个专家,总参数约 4000 亿,同样激活约 170 亿,指令版上下文为 100 万 token。
“专家”不是 16 或 128 个会聊天的独立角色。路由器会为不同 token 选择部分前馈网络计算,使模型拥有更大的总容量,同时控制单次计算量。
个人项目通常先看 Scout。Maverick 的完整权重、显存与多卡通信要求更高,更适合服务器级环境。Meta 在发布时还预览过 Behemoth 教师模型,但官方当前可下载型号列表仍以 Scout 与 Maverick 为主,不应把预览名称写成已发布权重。
## 17B active 为什么仍然很重
以 BF16 粗略估算,每个参数约占 2 字节。Scout 的 1090 亿总参数仅权重就超过 200 GB,尚未计入 KV 缓存、激活和框架开销。它不会因为每次只激活部分专家,就只需要装入 17B 权重。
官方模型卡称,Scout 通过运行时 INT4 量化可放入一张 H100;Maverick 提供 BF16 与 FP8 权重,FP8 版本可放入一台 H100 DGX 主机。这里的“单卡”是服务器级 80 GB GPU,不是普通 8 GB 游戏显卡。
CPU offload 能让部分权重放在系统内存,但 PCIe 来回搬运会显著降低速度。个人电脑若只是学习接口,托管推理通常比下载数百 GB 权重更实际。

## 三条入门路线
第一条是托管 API。选择提供 Llama 4 的服务商,用同一组小型评测比较价格、延迟、上下文上限和图像输入。服务商支持的上下文可能低于模型卡理论上限,模型量化与版本也可能不同,必须查看实际端点说明。
第二条是租用 GPU 服务器。它适合学习权重部署、批处理和量化。先运行 Scout 的小输入,再逐步增加上下文;不要第一次启动就塞入百万 token。
第三条是普通本地电脑。若没有服务器级显存,可先用更小的 Llama 3.2 或其他小模型练习提示模板、RAG 和工具调用,等工作流稳定后再换 Llama 4 端点。学习系统设计不要求一开始就加载最大模型。
## 获取权重前的准备
在 Hugging Face 的 Meta Llama 页面申请模型访问并接受相应许可,访问令牌放在环境变量或官方登录工具中,不要写进代码仓库。
创建独立 Python 环境,安装当前稳定版 PyTorch、Transformers、Accelerate 与 Hugging Face Hub。Llama 4 支持从 Transformers 4.51 起加入,但 2026 年不应固定依赖最早版本;记录实际可复现的包版本和 GPU 驱动。
下载前检查剩余磁盘、缓存目录和文件系统限制。模型仓库通常由多个大文件组成,中断后应依靠 Hub 客户端续传,不要手工拼接。
## 一个最小的文本推理骨架
下面示例展示接口结构,不代表普通电脑能够装下模型。量化、并行和鉴权要按所选环境补充。
```python
import torch
from transformers import AutoProcessor, Llama4ForConditionalGeneration
model_id = "meta-llama/Llama-4-Scout-17B-16E-Instruct"
processor = AutoProcessor.from_pretrained(model_id)
model = Llama4ForConditionalGeneration.from_pretrained(
model_id,
device_map="auto",
torch_dtype=torch.bfloat16,
attn_implementation="sdpa",
)
messages = [{
"role": "user",
"content": [{"type": "text", "text": "用三句话解释混合专家模型。"}],
}]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
output = model.generate(**inputs, max_new_tokens=128, do_sample=False)
new_tokens = output[0, inputs["input_ids"].shape[-1]:]
print(processor.decode(new_tokens, skip_special_tokens=True))
```
使用 `apply_chat_template` 比手写特殊 token 更稳妥。只解码新增 token,避免把整段提示再次打印。生产环境还要限制输入长度、输出长度、超时和并发。
## 加入图像时注意分辨率与顺序
Llama 4 的多模态输入通过 `AutoProcessor` 处理。消息内容里可以同时放图片和文字,图片应在问题语境中有明确位置。
不要把几十张原始大图直接投入一次请求。先缩放到任务需要的清晰度,记录裁剪与方向;文档图像要保证小字可读,场景识别则不必保留每个像素。
多图任务要测试顺序敏感性:交换两张图后,模型是否仍能正确引用。图像理解输出也可能产生幻觉,关键字段用 OCR、规则或人工复核。
## 百万上下文不等于一次塞满
Scout 的 1000 万 token 和 Maverick 的 100 万 token 是模型能力边界,不是默认请求长度。KV 缓存会随上下文增长,服务商也可能设更低限制。
长文档应用先做检索、去重和章节定位,再把相关片段送入模型。建立“针在开头、中间、结尾”的测试,测召回与引用准确率。若模型只会给出流畅摘要,却找不到具体依据,长窗口没有转化成可靠能力。

## 用小评测代替模型崇拜
准备 30 到 100 个真实样本,覆盖文本问答、图像理解、长文档、拒答和格式输出。记录正确率、引用、首 token 延迟、总时间、显存、成本和失败原因。
同一模型在不同量化、框架与服务商上的表现可能不同。版本升级前回放固定样本;工具调用或 JSON 输出要做解析校验,不能只看答案读起来是否自然。
预训练数据截止时间也重要。官方模型卡标明 Llama 4 训练数据新鲜度截至 2024 年 8 月。之后发生的事实要通过检索或外部数据源提供。
## 最适合个人开发者的第一步
先选一个窄任务,例如从产品截图提取结构化字段,或从三份技术文档回答带引用的问题。用托管 Scout 跑通处理、评测和错误回退,再决定是否值得租卡或自托管。
Llama 4 的价值不在于把最大上下文和全部权重都搬到桌面,而在于让开发者理解多模态、MoE 与开放权重部署的真实取舍。知道硬件边界,反而能更快做出能运行、能验证的第一个项目。
## 官方资料