Pular para o conteúdo
leonardobissoli.com
Todos os vídeos

comparativo · 24 de setembro de 2026 · 13:08

Bonsai 2: o LLM local comprimido em 9x vale a pena?

O Bonsai 2 da Prisma ML parte de um modelo de 27 bilhões de parâmetros e usa pesos ternários para ocupar menos memória. A Prisma anuncia retenção de 98,2% do desempenho agregado do original na bateria escolhida pela empresa. O autor testou a versão de 2 bits em MLX e conclui que continuaria com o Qwen 3.8, a menos que a memória seja uma limitação.

Bonsai 2: o LLM local comprimido em 9x vale a pena?

O que separa os dois

  1. 01Quantizar é guardar os pesos com menos bits

    Quantizar, de forma resumida, é guardar os pesos do modelo usando menos bits. Passar de 16 para 4 bits reduz o espaço de cada peso, mas os valores ficam aproximados, como guardar uma versão arredondada de um número.

  2. 02O que muda é a precisão, não a contagem de parâmetros

    Segundo o autor, o que muda é a precisão usada para guardar os pesos. A economia de memória vem de aceitar aproximações desses valores.

  3. 03Os tamanhos dependem do empacotamento

    O arquivo que a pessoa baixa muda a conta. Na ficha oficial, o pacote GGUF mais compacto fica cerca de 5,95 GB, outro empacotamento GGUF fica em torno de 7,21 GB e o pacote MLX usado pelo autor tem cerca de 8,6 GB no disco.

  4. 04A compressão de nove vezes compara com o original de 16 bits

    A comparação de nove vezes menor é feita com o original de 16 bits, que tem cerca de 54 GB. Uma versão Q4 usada como referência ocuparia 17,6 GB, então a redução em relação a ela fica perto de três vezes.

  5. 05A média de 98,2% esconde diferenças por tarefa

    A Prisma anuncia retenção de 98,2% do desempenho agregado do modelo original, o que não significa acertar 98% de tudo. Na ficha, as diferenças aparecem mais em conhecimento, raciocínio e visão, enquanto matemática e código ficam bem próximos.

  6. 06O autor mantém o Qwen 3.8

    O autor diz que tem memória suficiente para rodar o Qwen 3.8 de 27 bilhões, que o atende bem, e que sua preferência é continuar com ele. Ele só faria a troca se encontrasse uma vantagem prática no seu uso. Quem tem memória como limitação pode colocar o Bonsai 2 entre as opções para testar.

Nas palavras dele

“o tamanho anunciado não conta sozinho toda a história”

ouvir em 0:00

“O que muda é a precisão usada para guardar esses valores”

ouvir em 2:25

“um resultado geral não responde sozinho essa pergunta”

ouvir em 5:55

Perguntas

O Bonsai 2 substitui o Qwen 3.8?

Não. O autor diz que continuaria com o Qwen 3.8 nas tarefas dele e só faria a troca se encontrasse uma vantagem prática no seu uso.

O que significa a compressão de nove vezes?

É a comparação com o original de 16 bits, que tem cerca de 54 GB. Em relação a uma versão Q4, que ocuparia 17,6 GB, a redução fica perto de três vezes.

Qual pacote ocupa menos espaço?

Na ficha oficial, o pacote GGUF mais compacto fica cerca de 5,95 GB. O pacote MLX usado pelo autor tem cerca de 8,6 GB no disco.

Quer ir além do vídeo?

Continue por aqui

Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.