Pular para o conteúdo
leonardobissoli.com
Todos os vídeos

análise · 20 de agosto de 2026 · 11:07

Quanto custa rodar IA local: 4 opções de hardware

O vídeo percorre quatro faixas de preço para rodar IA local, de R$ 2.000 a R$ 15.000, e mostra que modelos com janela de contexto alta ainda não cabem numa máquina de consumo. A conclusão do autor é que a combinação de modelo local para tarefas específicas com APIs em nuvem para o resto é o caminho mais racional, começando por uma análise da própria necessidade antes de comprar hardware.

Quanto custa rodar IA local: 4 opções de hardware

O que muda na prática

  1. 01Quatro faixas de investimento

    R$ 2.000 com uma RTX 3060 de 12 GB abrange modelos de 14, 20 e 27 bilhões de parâmetros. R$ 5.000 permite 32 a 64 GB de RAM e modelos quantizados. R$ 10.000 chega a uma RTX 3090 de 24 GB de VRAM, com 30 bilhões. R$ 15.000 permite duas placas RTX.

  2. 02Ollama e LM Studio: dois caminhos para começar

    O simples é o Ollama: download, linha de comando, pull e run. O LM Studio oferece uma interface mais avançada. O autor destaca que manter os dois instalados ao mesmo tempo só consome recurso, e que a opção local pode usar modelos em nuvem ou baixados na máquina.

  3. 03O hardware do autor e o que ele suporta

    Máquina Apple, 14 CPUs, 410 GB/s de largura de banda e 36 GB de RAM. Ela roda o necessário para o dia a dia, mas modelos grandes exigem memória demais e ficam lentos. O autor usa modelos MLX, a tecnologia da própria Apple para integrar memória e processo.

  4. 04O que não funciona (e o que funciona)

    Muita gente acha que já dá para rodar Opus ou Sonet localmente. O autor diz que, com janela de contexto alta, a máquina necessária inviabiliza a compra e o resultado não compensa. Quem quer começar a entender modelagem local sem gastar token, porém, encontra espaço nas faixas de entrada.

  5. 05Uso prático no fluxo de produção

    O autor usa modelo local para transformar vídeos em posts do site, com uma base de conhecimento de 3.904 vídeos indexados. O Job Mat e a ingestão de dados com base local rodam na máquina. Serviços como Minimax e APIs ficam na nuvem. A combinação atende o fluxo sem dependência total de uma ponta só.

  6. 06O veredito: híbrido ganha para quem produz conteúdo

    No workflow do autor, imagem, vídeo e todo o fluxo do YouTube não funcionam localmente. Ele mantém Claude Max, GPT, Minimax e Higgsfield na nuvem, com o local cuidando da parte de texto e dados. A recomendação final é mapear a necessidade antes de tocar em hardware.

Nas palavras dele

“não faz sentido você ter dois, só vai consumir recurso da sua máquina”

ouvir em 2:30

“não vale a pena eu fazer um investimento bizarro para fazer isso”

ouvir em 10:50

“você precisa primeiro entender a sua necessidade para depois montar um setup”

ouvir em 11:00

Perguntas

Dá para rodar Sonet localmente?

O autor diz que, ao menos com janela de contexto alta, não vai funcionar: a máquina teria que ser muito boa, e ele conclui que o caminho não compensa.

Ollama ou LM Studio?

Ollama é mais simples, funciona por linha de comando. LM Studio tem interface mais avançada. O autor usa ambos, mas em momentos diferentes, e diz que não faz sentido manter os dois instalados ao mesmo tempo.

Vale a pena rodar IA local?

Depende do uso. Para testes sem gastar token e para tarefas como ingestão de dados, compensa. Para workflow com muita imagem e vídeo, o autor diz que não vale o investimento.

Quer ir além do vídeo?

Continue por aqui

Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.