Pular para o conteúdo
leonardobissoli.com
Todos os vídeos

tutorial · 16 de julho de 2026 · 8:57

Como rodar LLM local e parar de pagar tokens de API

O vídeo mostra como rodar LLMs locais com Ollama e LM Studio para zerar a conta de API. Explica requisitos de hardware, instalação, comandos principais e integração com Claude Code e OpenCode. Compara as três ferramentas: Ollama, LM Studio e MLX.

Como rodar LLM local e parar de pagar tokens de API

O passo a passo

  1. 01Por que rodar LLM local

    O autor cita que usou 16 milhões de tokens em um dia e 760 milhões no total. Os dois motivos apresentados são economia de tokens e privacidade, já que tudo fica na máquina local.

  2. 02Requisitos de hardware

    CPU faz uma coisa bem de cada vez, GPU roda várias em paralelo, RAM é onde o modelo fica quando executa e banda de memória é a velocidade de leitura. O autor usa 14 CPU cores e 32 GPU cores como exemplo.

  3. 03Ferramentas: Ollama e LM Studio

    São os dois runners mostrados no vídeo para executar modelos locais. Ollama é simples e direto, LM Studio tem interface gráfica mais detalhada.

  4. 04Instalando o Ollama na prática

    Basta rodar o comando de instalação, depois usar ollama pull para baixar o modelo e ollama run para executar. O Ollama também tem uma versão paga chamada Ollama Cloud.

  5. 05Integrando com Claude Code e OpenCode

    No OpenCode o modelo local aparece em /model. No Claude Code basta carregar o modelo que ele aparece na seleção. Também dá para integrar com Codex, Copilot, Droid e outros.

  6. 06LM Studio em modo servidor

    Tem aba de chat, servidor com IP e porta, aba para carregar modelos como o Qwen 35B de 20 GB e configuração de contexto, temperatura e sampling.

  7. 07Comparativo entre as ferramentas

    Ollama é mais rápido para começar e simples. LM Studio tem interface melhor para baixar e configurar modelos. MLX é mais técnico, voltado para Apple Silicon (M1, M2, M3, M4). O autor não recomenda instalar Ollama e LM Studio juntos.

Nas palavras dele

“hoje eu usei aproximadamente 16 milhões de tokens”

ouvir em 0:00

“Tudo vai ficar local na sua máquina. Ninguém, nada vai ter acesso a esses dados.”

ouvir em 0:50

“É aonde que o LM Studio ganha. Ele tem uma opção mais legal, uma interface mais fácil de você baixar os modelos, de você configurar.”

ouvir em 7:30

“O que eu não recomendo é você instalar os dois, porque vai pesar a sua máquina, você vai ficar com dois servidores runners executando e não tem necessidade.”

ouvir em 7:30

Perguntas

Quanto custa rodar um LLM local?

O custo de tokens é zero. Dá para executar quantos projetos quiser sem custo e sem surpresa no fim do mês.

Quais ferramentas usar para rodar LLM local?

O vídeo apresenta Ollama e LM Studio como as duas opções para executar modelos locais na máquina.

Quais são os comandos principais do Ollama?

Ollama list lista os modelos, ollama run carrega o modelo na memória, ollama ps mostra os modelos em execução e ollama pull baixa o modelo.

Como integrar LLM local com Claude Code?

Basta carregar o modelo no Ollama que ele aparece na seleção de modelos do Claude Code, igual ao exemplo mostrado com o Gemma 4.

Vale instalar Ollama e LM Studio ao mesmo tempo?

Não. O autor não recomenda porque ficam dois servidores runners rodando e pesa a máquina sem necessidade.

Quer ir além do vídeo?

Continue por aqui

Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.