Ir para o conteúdo principal
AIDive
PT
Entrar
Como baixar, instalar e executar Llama 4

Como baixar, instalar e executar Llama 4

Instruções para baixar, instalar e usar Llama 4 Scout e Maverick

AIDive Desk
0

LLama 4 — é uma nova série de modelos de linguagem da Meta*, desenvolvida para trabalhar com texto, código, prompts em diálogos e outras tarefas de processamento de linguagem natural. É posicionada como uma alternativa aberta ao GPT-4. Pode ser usada para criar chatbots, gerar texto, analisar documentos, automatizar tarefas e outros cenários em que seja necessária geração de linguagem de qualidade.

⚠️ Aviso

Antes de seguir para a instalação, considere alguns pontos importantes:

Os modelos LLaMA 4 são muito grandes — de 100 a 220 GB. Eles exigem bastante espaço em disco.

Os modelos usam a arquitetura Mixture of Experts e exigem hardware potente — no processador, funcionam lentamente, e na maioria dos notebooks não rodam diretamente.

No momento da publicação, a Meta fornece apenas os pesos no formato .safetensors, que não podem ser executados via llama.cpp. Para rodar, será necessária a biblioteca transformers, text-generation-webui ou adaptação para soluções de terceiros.

Mesmo a instalação e o download vão levar bastante tempo — verifique se você tem uma conexão de internet estável.

Erros

Durante a instalação e a execução do modelo, quase certamente surgirão erros: incompatibilidade de versões de bibliotecas, falta de memória, caminho de arquivo incorreto, erros de importação — tudo isso faz parte do processo.

Cole isso em qualquer chatbot, por exemplo:

ChatGPT da OpenAI;

Claude da Anthropic;

Grok da xAI.

Explique que você está instalando o LLama 4 localmente e peça para analisar o erro.

Obter acesso ao Llama 4

O acesso aos modelos Llama 4 Scout e Maverick é fornecido sem restrições. É preciso abrir a página oficial, selecionar Download models e preencher os dados:

Nome;

Sobrenome;

Data de nascimento;

Email;

País;

Nome da empresa — você pode inventar ou informar uma existente;

Cargo — escolha qualquer opção da lista.

Instalação do Llama 4

Depois de preencher os dados, você receberá um ID de solicitação e instruções para baixar os modelos. É possível baixá-los em até 48 horas, até 5 vezes, usando links exclusivos. Eles serão enviados para o endereço de email informado.

Preparando a pasta para o modelo

✅ macOS:

`cd ~/Downloads mkdir -p llama/models cd llama/models`

💻 Windows, cmd:

`cd %USERPROFILE%\\Downloads mkdir llama\\models cd llama\\models`

Em vez de %USERPROFILE%, você precisa informar o nome do perfil no Windows, por exemplo Admin.

Baixando LLaMA 4 Scout ou Maverick via curl ou Invoke-WebRequest

A Meta fornece um link exclusivo para baixar o modelo, válido por 48 horas. Ele se parece com isto:

Não tente usar o link da instrução, ele é inválido

https://llama4.llamameta.net/?Policy=eyJTdGF0ZW1lbnQiOlt7InVuaXF1ZV9oYXNoIjoicGgxeGRqOGx3bHIwYTU2YWVpMjM5ZDNpIiwiUmVzb3VyY2UiOiJodHRwczpcL1wvbGxhbWE0LmxsYW1hbWV0W70z-gRaD4DsMGSiu4i55xt4nIohvUC6QB5weJBShoYdiLhcCUQii6-ZyAgBgBcOl67-5wWEhoLwnlkJf5s4XvZaMYqKCJ6SGMK9MidUsVk12NUoBhEwh7kzlvBXbqElbeF%7E26dE1N8v3lS0rLD3OJ3Hk636bNb78GuRqNgQYt21vuA7PuGjKJsMlUyc7Ds7JJMOjpim5ihr4xQQmk-sjUJOlbMNDaKXnUBQ-UytMAwAxw3d9uL2JJ7u2y9A\_\_&Key-Pair-Id=...&Download-Request-ID=...

Importante: não altere a URL e não insira * no endereço! Isso causará erro 403.

✅ macOS:

curl -L -o llama-4-scout-17b-instruct.safetensors "Link"

💻 Windows PowerShell:

Invoke-WebRequest \\\\ -Uri "Link"`

Ou 💻 Windows cmd + wget:

wget "Link" -O llama-4-scout-17b-instruct.safetensors

**Resultado: arquivo **`.safetensors`

Após o download bem-sucedido, você receberá o arquivo:

llama-4-scout-17b-instruct.safetensors

Tamanho: de 100 a 220 GB, dependendo da versão.

O que fazer depois de baixar .safetensors

O arquivo .safetensors que você baixou contém os pesos do modelo LLaMA 4. Você pode executá-lo de algumas formas — dependendo dos seus objetivos e das capacidades do computador.

Opção 1. Usar transformers do Hugging Face no CPU

Este método é adequado para testes ou para trabalhar com prompts curtos. Funciona no CPU, sem placa de vídeo.

Passo 1. Instalar dependências

✅ macOS:

pip install transformers accelerate sentencepiece

💻 Windows (cmd ou PowerShell):

pip install transformers accelerate sentencepiece

Passo 2. Código mínimo para executar o modelo

Crie o arquivo run\_llama.py com o seguinte conteúdo:

from transformers import AutoTokenizer, AutoModelForCausalLM import torch model_path = "./llama-4-scout-17b-instruct.safetensors" # caminho para o modelo tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct", use_fast=False) model = AutoModelForCausalLM.from_pretrained( model_path, torch_dtype=torch.float32, # CPU low_cpu_mem_usage=True, device_map="auto", ) prompt = "Explique de forma breve como funciona a rede neural LLaMA 4." inputs = tokenizer(prompt, return_tensors="pt") with torch.no_grad(): outputs = model.generate(**inputs, max_new_tokens=150) print(tokenizer.decode(outputs[0], skip_special_tokens=True))

meta-llama/Meta-Llama-3-8B-Instruct aqui é usado apenas para carregar o tokenizer — substitua se a Meta lançar o tokenizer do LLaMA 4 separadamente.

Execução:

python run_llama.py

Opção 2. Conectar ao WebUI (text-generation-webui)

Se você quiser uma interface gráfica prática no navegador, pode usar text-generation-webui:

Clone o repositório:

git clone https://github.com/oobabooga/text-generation-webui cd text-generation-webui

Copie o modelo .safetensors para a pasta models/llama4

Execute:

python server.py --model llama4

Esta opção exige a instalação de bibliotecas adicionais. É indicada para usuários avançados e servidores com GPU.

Exemplos de uso do LLama 4

Mesmo que você não seja desenvolvedor e não execute o LLaMA 4 em produção, ainda é possível resolver tarefas simples, mas interessantes, diretamente no seu computador.

Criação de um chatbot local

Execute o LLama 4 no modo Instruct e faça perguntas em qualquer estilo — de assuntos profissionais aos cotidianos. O modelo pode:

explicar temas complexos em linguagem simples;

ajudar com textos — e-mails, planos, currículos;

manter um diálogo em formato conveniente, mesmo sem internet.

Exemplo de pergunta:

Explique de forma simples como funcionam as criptomoedas.

Geração de histórias, e-mails e ideias

Com a LLaMA 4, você pode escrever:

histórias curtas e cenas para livros;

textos motivacionais;

roteiros para vídeos, TikTok ou podcast.

Exemplo de prompt:

Crie uma história divertida.

*Meta - proibida no território da Federação Russa.

Resumo

  • Autor
    AIDive Desk
    AIDive Desk
  • Publicado7 de abril de 2025
  • Visualizações

Categorias

    0 comentário

    Newsletter

    Receba notificações quando novas ferramentas de IA forem adicionadas

    Junte-se à comunidade.