
Como baixar, instalar e executar Llama 4
Instruções para baixar, instalar e usar Llama 4 Scout e Maverick
LLama 4 — é uma nova série de modelos de linguagem da Meta*, desenvolvida para trabalhar com texto, código, prompts em diálogos e outras tarefas de processamento de linguagem natural. É posicionada como uma alternativa aberta ao GPT-4. Pode ser usada para criar chatbots, gerar texto, analisar documentos, automatizar tarefas e outros cenários em que seja necessária geração de linguagem de qualidade.
⚠️ Aviso
Antes de seguir para a instalação, considere alguns pontos importantes:
Os modelos LLaMA 4 são muito grandes — de 100 a 220 GB. Eles exigem bastante espaço em disco.
Os modelos usam a arquitetura Mixture of Experts e exigem hardware potente — no processador, funcionam lentamente, e na maioria dos notebooks não rodam diretamente.
No momento da publicação, a Meta fornece apenas os pesos no formato .safetensors, que não podem ser executados via llama.cpp. Para rodar, será necessária a biblioteca transformers, text-generation-webui ou adaptação para soluções de terceiros.
Mesmo a instalação e o download vão levar bastante tempo — verifique se você tem uma conexão de internet estável.
Erros
Durante a instalação e a execução do modelo, quase certamente surgirão erros: incompatibilidade de versões de bibliotecas, falta de memória, caminho de arquivo incorreto, erros de importação — tudo isso faz parte do processo.
Cole isso em qualquer chatbot, por exemplo:
ChatGPT da OpenAI;
Claude da Anthropic;
Grok da xAI.
Explique que você está instalando o LLama 4 localmente e peça para analisar o erro.
Obter acesso ao Llama 4
O acesso aos modelos Llama 4 Scout e Maverick é fornecido sem restrições. É preciso abrir a página oficial, selecionar Download models e preencher os dados:
Nome;
Sobrenome;
Data de nascimento;
Email;
País;
Nome da empresa — você pode inventar ou informar uma existente;
Cargo — escolha qualquer opção da lista.
Instalação do Llama 4
Depois de preencher os dados, você receberá um ID de solicitação e instruções para baixar os modelos. É possível baixá-los em até 48 horas, até 5 vezes, usando links exclusivos. Eles serão enviados para o endereço de email informado.
Preparando a pasta para o modelo
✅ macOS:
`cd ~/Downloads mkdir -p llama/models cd llama/models`
💻 Windows, cmd:
`cd %USERPROFILE%\\Downloads mkdir llama\\models cd llama\\models`
Em vez de %USERPROFILE%, você precisa informar o nome do perfil no Windows, por exemplo Admin.
Baixando LLaMA 4 Scout ou Maverick via curl ou Invoke-WebRequest
A Meta fornece um link exclusivo para baixar o modelo, válido por 48 horas. Ele se parece com isto:
Não tente usar o link da instrução, ele é inválido
https://llama4.llamameta.net/?Policy=eyJTdGF0ZW1lbnQiOlt7InVuaXF1ZV9oYXNoIjoicGgxeGRqOGx3bHIwYTU2YWVpMjM5ZDNpIiwiUmVzb3VyY2UiOiJodHRwczpcL1wvbGxhbWE0LmxsYW1hbWV0W70z-gRaD4DsMGSiu4i55xt4nIohvUC6QB5weJBShoYdiLhcCUQii6-ZyAgBgBcOl67-5wWEhoLwnlkJf5s4XvZaMYqKCJ6SGMK9MidUsVk12NUoBhEwh7kzlvBXbqElbeF%7E26dE1N8v3lS0rLD3OJ3Hk636bNb78GuRqNgQYt21vuA7PuGjKJsMlUyc7Ds7JJMOjpim5ihr4xQQmk-sjUJOlbMNDaKXnUBQ-UytMAwAxw3d9uL2JJ7u2y9A\_\_&Key-Pair-Id=...&Download-Request-ID=...
Importante: não altere a URL e não insira * no endereço! Isso causará erro 403.
✅ macOS:
curl -L -o llama-4-scout-17b-instruct.safetensors "Link"
💻 Windows PowerShell:
Invoke-WebRequest \\\\
-Uri "Link"`
Ou 💻 Windows cmd + wget:
wget "Link" -O llama-4-scout-17b-instruct.safetensors
**Resultado: arquivo **`.safetensors`
Após o download bem-sucedido, você receberá o arquivo:
llama-4-scout-17b-instruct.safetensors
Tamanho: de 100 a 220 GB, dependendo da versão.
O que fazer depois de baixar .safetensors
O arquivo .safetensors que você baixou contém os pesos do modelo LLaMA 4. Você pode executá-lo de algumas formas — dependendo dos seus objetivos e das capacidades do computador.
Opção 1. Usar transformers do Hugging Face no CPU
Este método é adequado para testes ou para trabalhar com prompts curtos. Funciona no CPU, sem placa de vídeo.
Passo 1. Instalar dependências
✅ macOS:
pip install transformers accelerate sentencepiece
💻 Windows (cmd ou PowerShell):
pip install transformers accelerate sentencepiece
Passo 2. Código mínimo para executar o modelo
Crie o arquivo run\_llama.py com o seguinte conteúdo:
from transformers import AutoTokenizer, AutoModelForCausalLM import torch model_path = "./llama-4-scout-17b-instruct.safetensors" # caminho para o modelo tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct", use_fast=False) model = AutoModelForCausalLM.from_pretrained( model_path, torch_dtype=torch.float32, # CPU low_cpu_mem_usage=True, device_map="auto", ) prompt = "Explique de forma breve como funciona a rede neural LLaMA 4." inputs = tokenizer(prompt, return_tensors="pt") with torch.no_grad(): outputs = model.generate(**inputs, max_new_tokens=150) print(tokenizer.decode(outputs[0], skip_special_tokens=True))
❗ meta-llama/Meta-Llama-3-8B-Instruct aqui é usado apenas para carregar o tokenizer — substitua se a Meta lançar o tokenizer do LLaMA 4 separadamente.
Execução:
python run_llama.py
Opção 2. Conectar ao WebUI (text-generation-webui)
Se você quiser uma interface gráfica prática no navegador, pode usar text-generation-webui:
Clone o repositório:
git clone https://github.com/oobabooga/text-generation-webui cd text-generation-webui
Copie o modelo .safetensors para a pasta models/llama4
Execute:
python server.py --model llama4
Esta opção exige a instalação de bibliotecas adicionais. É indicada para usuários avançados e servidores com GPU.
Exemplos de uso do LLama 4
Mesmo que você não seja desenvolvedor e não execute o LLaMA 4 em produção, ainda é possível resolver tarefas simples, mas interessantes, diretamente no seu computador.
Criação de um chatbot local
Execute o LLama 4 no modo Instruct e faça perguntas em qualquer estilo — de assuntos profissionais aos cotidianos. O modelo pode:
explicar temas complexos em linguagem simples;
ajudar com textos — e-mails, planos, currículos;
manter um diálogo em formato conveniente, mesmo sem internet.
Exemplo de pergunta:
Explique de forma simples como funcionam as criptomoedas.
Geração de histórias, e-mails e ideias
Com a LLaMA 4, você pode escrever:
histórias curtas e cenas para livros;
textos motivacionais;
roteiros para vídeos, TikTok ou podcast.
Exemplo de prompt:
Crie uma história divertida.
*Meta - proibida no território da Federação Russa.
