Pular para o conteúdo
leonardobissoli.com
Todos os vídeos

análise · 06 de setembro de 2026 · 12:40

Qwen 3.8 27B local: prós, contras e quando usar

O autor usa o Qwen 3.8 27B localmente nos seus fluxos de trabalho. Em tarefas interativas, o modelo na nuvem foi cerca de cinco vezes mais rápido, mas para jobs em background, como ingestão de vídeos e pesquisas profundas, rodar local economiza tokens e funciona bem no fluxo dele.

Qwen 3.8 27B local: prós, contras e quando usar

O que muda na prática

  1. 01Quantização reduz tamanho, mas perde precisão

    Quantizar é guardar os pesos com menos bits (de 16 para 4), o que diminui a memória usada mas aproxima os valores, podendo afetar a qualidade das respostas.

  2. 02Setup no Mac Studio com MLX

    O autor roda o Qwen 3.8 27B em um Mac Studio com chip M4 Max, 14 CPUs, 32 GPUs, 410 GB/s de largura de banda e 36 GB de memória, usando o framework MLX da Apple para otimizar modelos em Apple Silicon.

  3. 03Modelo ocupa cerca de 18 GB e é gerenciado pelo Ollama

    O arquivo do modelo tem aproximadamente 18 GB. O autor usa o Ollama para listar e inspecionar os modelos locais, com comandos como ollama list e ollama show.

  4. 04Mais lento que a nuvem no teste prático

    No teste gerando um vídeo de exemplo com Remotion no estilo 12 infográfico, o modelo na nuvem (SWE 1.7, esforço médio) terminou em cerca de 1 minuto, enquanto o Qwen local levou 5 minutos para a mesma tarefa.

  5. 05Onde o Qwen local faz sentido

    Para jobs em background como ingestão de vídeos do YouTube e geração automática de posts e páginas no site, o Qwen local roda à noite sem consumir tokens e sem depender de acompanhamento.

  6. 06Gate valida antes de publicar

    Antes de subir para o site, um gate verifica o conteúdo gerado. Se reprovar, o autor recebe uma notificação e ajusta o processo a cada reprovação.

  7. 07A conta é tempo versus tokens

    A escolha depende de trocar tokens por tempo de espera. Em tarefas interativas a nuvem compensa mais mesmo gratuita; em tarefas onde o tempo não é crítico, o local ganha.

Nas palavras dele

“Qwen 3.8 de 27 bilhões, ele é um modelo quantado.”

ouvir em 1:00

“Quantar é guardar os pesos usando menos bits, que, por exemplo, passamos de 16 para 4, reduzindo o espaço ocupado.”

ouvir em 1:30

“MLX é como se fosse o motor da Apple. é o framework que a Apple tem para otimizar os modelos rodando em Apple Silicon”

ouvir em 3:40

“ele demorou 5 minutos, ou seja, demorou cinco vezes mais de fazer do que o que eu tenho no modelo cloud, que é o SWE”

ouvir em 8:00

“economia de tokens versus economia de tempo, isso é uma coisa que você precisa avaliar no seu workflow, nos seus projetos”

ouvir em 8:30

“O meu caso de uso pro Qwen é para ingestão de vídeos e fazer toda a parte de criação de posts e páginas no meu site.”

ouvir em 9:00

Perguntas

O que é quantização de modelos LLM?

Quantizar é guardar os pesos do modelo usando menos bits, por exemplo passando de 16 para 4, o que reduz o espaço ocupado em memória em troca de perda de precisão nos valores.

Quanto tempo o Qwen 3.8 27B levou no teste local comparado à nuvem?

No teste gerando um vídeo com Remotion, o modelo na nuvem (SWE 1.7) terminou em cerca de 1 minuto, enquanto o Qwen local levou 5 minutos para a mesma tarefa.

Para que o autor usa o Qwen 3.8 27B rodando localmente?

Para ingestão de vídeos do YouTube em background, gerando posts, páginas e capítulos no site automaticamente, além de pesquisas profundas em segundo plano.

O Qwen local passa por alguma validação antes de publicar no site?

Sim, existe um gate que verifica o conteúdo gerado antes de subir para o site. Se reprovar, o autor recebe uma notificação e ajusta o processo.

Quer ir além do vídeo?

Continue por aqui

Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.