análise · 06 de setembro de 2026 · 12:40
Qwen 3.8 27B local: prós, contras e quando usar
O autor usa o Qwen 3.8 27B localmente nos seus fluxos de trabalho. Em tarefas interativas, o modelo na nuvem foi cerca de cinco vezes mais rápido, mas para jobs em background, como ingestão de vídeos e pesquisas profundas, rodar local economiza tokens e funciona bem no fluxo dele.

O que muda na prática
01Quantização reduz tamanho, mas perde precisão
Quantizar é guardar os pesos com menos bits (de 16 para 4), o que diminui a memória usada mas aproxima os valores, podendo afetar a qualidade das respostas.
02Setup no Mac Studio com MLX
O autor roda o Qwen 3.8 27B em um Mac Studio com chip M4 Max, 14 CPUs, 32 GPUs, 410 GB/s de largura de banda e 36 GB de memória, usando o framework MLX da Apple para otimizar modelos em Apple Silicon.
03Modelo ocupa cerca de 18 GB e é gerenciado pelo Ollama
O arquivo do modelo tem aproximadamente 18 GB. O autor usa o Ollama para listar e inspecionar os modelos locais, com comandos como ollama list e ollama show.
04Mais lento que a nuvem no teste prático
No teste gerando um vídeo de exemplo com Remotion no estilo 12 infográfico, o modelo na nuvem (SWE 1.7, esforço médio) terminou em cerca de 1 minuto, enquanto o Qwen local levou 5 minutos para a mesma tarefa.
05Onde o Qwen local faz sentido
Para jobs em background como ingestão de vídeos do YouTube e geração automática de posts e páginas no site, o Qwen local roda à noite sem consumir tokens e sem depender de acompanhamento.
06Gate valida antes de publicar
Antes de subir para o site, um gate verifica o conteúdo gerado. Se reprovar, o autor recebe uma notificação e ajusta o processo a cada reprovação.
07A conta é tempo versus tokens
A escolha depende de trocar tokens por tempo de espera. Em tarefas interativas a nuvem compensa mais mesmo gratuita; em tarefas onde o tempo não é crítico, o local ganha.
Nas palavras dele
“Qwen 3.8 de 27 bilhões, ele é um modelo quantado.”
ouvir em 1:00
“Quantar é guardar os pesos usando menos bits, que, por exemplo, passamos de 16 para 4, reduzindo o espaço ocupado.”
ouvir em 1:30
“MLX é como se fosse o motor da Apple. é o framework que a Apple tem para otimizar os modelos rodando em Apple Silicon”
ouvir em 3:40
“ele demorou 5 minutos, ou seja, demorou cinco vezes mais de fazer do que o que eu tenho no modelo cloud, que é o SWE”
ouvir em 8:00
“economia de tokens versus economia de tempo, isso é uma coisa que você precisa avaliar no seu workflow, nos seus projetos”
ouvir em 8:30
“O meu caso de uso pro Qwen é para ingestão de vídeos e fazer toda a parte de criação de posts e páginas no meu site.”
ouvir em 9:00
Perguntas
O que é quantização de modelos LLM?
Quantizar é guardar os pesos do modelo usando menos bits, por exemplo passando de 16 para 4, o que reduz o espaço ocupado em memória em troca de perda de precisão nos valores.
Quanto tempo o Qwen 3.8 27B levou no teste local comparado à nuvem?
No teste gerando um vídeo com Remotion, o modelo na nuvem (SWE 1.7) terminou em cerca de 1 minuto, enquanto o Qwen local levou 5 minutos para a mesma tarefa.
Para que o autor usa o Qwen 3.8 27B rodando localmente?
Para ingestão de vídeos do YouTube em background, gerando posts, páginas e capítulos no site automaticamente, além de pesquisas profundas em segundo plano.
O Qwen local passa por alguma validação antes de publicar no site?
Sim, existe um gate que verifica o conteúdo gerado antes de subir para o site. Se reprovar, o autor recebe uma notificação e ajusta o processo.
Quer ir além do vídeo?
Continue por aqui
Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.