comparativo · 24 de setembro de 2026 · 13:08
Bonsai 2: o LLM local comprimido em 9x vale a pena?
O Bonsai 2 da Prisma ML parte de um modelo de 27 bilhões de parâmetros e usa pesos ternários para ocupar menos memória. A Prisma anuncia retenção de 98,2% do desempenho agregado do original na bateria escolhida pela empresa. O autor testou a versão de 2 bits em MLX e conclui que continuaria com o Qwen 3.8, a menos que a memória seja uma limitação.

O que separa os dois
01Quantizar é guardar os pesos com menos bits
Quantizar, de forma resumida, é guardar os pesos do modelo usando menos bits. Passar de 16 para 4 bits reduz o espaço de cada peso, mas os valores ficam aproximados, como guardar uma versão arredondada de um número.
02O que muda é a precisão, não a contagem de parâmetros
Segundo o autor, o que muda é a precisão usada para guardar os pesos. A economia de memória vem de aceitar aproximações desses valores.
03Os tamanhos dependem do empacotamento
O arquivo que a pessoa baixa muda a conta. Na ficha oficial, o pacote GGUF mais compacto fica cerca de 5,95 GB, outro empacotamento GGUF fica em torno de 7,21 GB e o pacote MLX usado pelo autor tem cerca de 8,6 GB no disco.
04A compressão de nove vezes compara com o original de 16 bits
A comparação de nove vezes menor é feita com o original de 16 bits, que tem cerca de 54 GB. Uma versão Q4 usada como referência ocuparia 17,6 GB, então a redução em relação a ela fica perto de três vezes.
05A média de 98,2% esconde diferenças por tarefa
A Prisma anuncia retenção de 98,2% do desempenho agregado do modelo original, o que não significa acertar 98% de tudo. Na ficha, as diferenças aparecem mais em conhecimento, raciocínio e visão, enquanto matemática e código ficam bem próximos.
06O autor mantém o Qwen 3.8
O autor diz que tem memória suficiente para rodar o Qwen 3.8 de 27 bilhões, que o atende bem, e que sua preferência é continuar com ele. Ele só faria a troca se encontrasse uma vantagem prática no seu uso. Quem tem memória como limitação pode colocar o Bonsai 2 entre as opções para testar.
Nas palavras dele
“o tamanho anunciado não conta sozinho toda a história”
ouvir em 0:00
“O que muda é a precisão usada para guardar esses valores”
ouvir em 2:25
“um resultado geral não responde sozinho essa pergunta”
ouvir em 5:55
Perguntas
O Bonsai 2 substitui o Qwen 3.8?
Não. O autor diz que continuaria com o Qwen 3.8 nas tarefas dele e só faria a troca se encontrasse uma vantagem prática no seu uso.
O que significa a compressão de nove vezes?
É a comparação com o original de 16 bits, que tem cerca de 54 GB. Em relação a uma versão Q4, que ocuparia 17,6 GB, a redução fica perto de três vezes.
Qual pacote ocupa menos espaço?
Na ficha oficial, o pacote GGUF mais compacto fica cerca de 5,95 GB. O pacote MLX usado pelo autor tem cerca de 8,6 GB no disco.
Quer ir além do vídeo?
Continue por aqui
Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.