{"content_id":"vupqjenc6z","slug":"meta-muse-glimmer-local-ai-agent-model","locale":"pt","schema_type":"TechArticle","category":"ai_data","category_name":"Dados de IA","title":"Meta Muse Glimmer: pontos essenciais do modelo local de IA de 30 bilhões de parâmetros para notebooks","summary":"Muse Glimmer foi apresentado como um modelo multimodal com cerca de 30 bilhões de parâmetros, quantizado para rodar em hardware de consumo e voltado a agentes locais de IA que usam ferramentas por longos períodos. No entanto, como os números de memória, velocidade e benchmarks são medições da própria Meta citadas no material fornecido, é necessário confirmá-los por meio da ficha oficial do modelo e de avaliações independentes.","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Muse Glimmer busca ser um agente de IA de execução prolongada que lida com arquivos, telas e ferramentas, e não apenas um chatbot local.","Segundo o material fornecido, a versão com quantização de 4 bits foi projetada para executar o sistema completo em ambientes com cerca de 24 GB ou 32 GB de memória.","A decodificação especulativa com o DFlash drafter processa vários tokens candidatos de uma só vez, após a verificação pelo modelo principal.","O processamento local pode reduzir o envio externo de dados, mas não elimina riscos de injeção de prompt, permissões excessivas do sistema ou danos a arquivos.","O desempenho e a licença devem ser avaliados somente após a consulta à ficha do modelo no repositório oficial, ao arquivo de licença real e aos resultados de medições independentes em cada hardware."],"content_markdown":"O Meta Muse Glimmer foi apresentado como um modelo com cerca de 30 bilhões de parâmetros, projetado para ser executado em PCs pessoais ou notebooks de alto desempenho e servir de base para agentes de IA locais capazes de operar por longos períodos. Seu objetivo central vai além da geração de texto: compreender imagens e telas e usar ferramentas como arquivos, funções e terminal em várias etapas.\n\nAs especificações do produto e os números de benchmarks deste artigo foram organizados com base nos anúncios da Meta citados no material fornecido. Como não foram disponibilizadas URLs diretas do artigo original nem do cartão oficial do modelo, os números não devem ser interpretados como resultados verificados de forma independente.\n\n## Principais especificações do Muse Glimmer\n\nAs principais especificações descritas no material fornecido são as seguintes.\n\n| Item | Conteúdo apresentado | Cuidados na interpretação |\n|---|---|---|\n| Escala do modelo | Cerca de 30 bilhões de parâmetros | É necessário consultar o cartão do modelo para verificar os parâmetros realmente ativos e os detalhes da arquitetura |\n| Formatos de entrada | Texto e imagens | É necessário verificar separadamente a resolução de imagem compatível, o número de quadros e o custo dos tokens de visão |\n| Contexto | Máximo de pelo menos 131.072 tokens | A precisão e o uso de memória no comprimento máximo podem ser diferentes dos observados com entradas curtas |\n| Idiomas | Pelo menos 100 idiomas | Isso não significa que a qualidade seja igual em todos os idiomas |\n| Versões de baixa precisão | K-Quant-17GB, K-Quant-Dynamic | A capacidade incluída no nome deve ser diferenciada da memória total necessária para execução |\n| Principais usos | Programação, automação de desktop, chamadas de função, análise de documentos e avaliação | Os recursos reais dependem do runtime conectado e das políticas de permissão |\n| Método de aceleração | Speculative Decoding com o drafter DFlash | O nível de aceleração varia conforme o hardware e o comprimento da entrada |\n| Formato de disponibilização | BF16, quantização de 4 bits e modelo drafter | É necessário verificar no repositório os arquivos fornecidos e os runtimes compatíveis |\n| Licença | Apresentada como Apache License 2.0 | É necessário verificar a LICENSE real do repositório do modelo e eventuais condições adicionais de uso |\n\n## Como 30 bilhões de parâmetros funcionam em 24GB\n\n### Cálculo simples da memória dos pesos\n\nConsiderando apenas os pesos do modelo, o espaço de armazenamento necessário pode ser calculado aproximadamente da seguinte forma.\n\n- BF16 ou FP16: 30 bilhões × 2 bytes = cerca de 60GB\n- 8 bits: 30 bilhões × 1 byte = cerca de 30GB\n- 4 bits: 30 bilhões × 0,5 byte = cerca de 15GB\n\nAos pesos de 4 bits são acrescentados escalas de quantização, metadados, alinhamento e overhead do runtime. Por isso, o pacote de pesos com cerca de 17GB mencionado no material fornecido pode ser maior do que os 15GB teóricos.\n\n### Memória necessária além dos pesos\n\nA existência de um arquivo de modelo de 17GB não significa que ele possa ser executado diretamente em um dispositivo com 17GB de memória. Na inferência real, os componentes a seguir também ocupam espaço.\n\n- Cache KV que preserva o histórico de entrada e saída\n- Codificador de visão que processa entradas de imagem\n- Ativações intermediárias e espaço de trabalho do runtime\n- Modelos auxiliares, como o drafter DFlash\n- Uso do sistema operacional, do desktop e de outros aplicativos\n- Buffers e espaço de cópia entre a GPU e a memória do sistema\n\nO material fornecido descreve o K-Quant-17GB como uma versão destinada a ambientes com cerca de 24GB, e o K-Quant-Dynamic como uma versão para ambientes com cerca de 32GB. No entanto, é necessário consultar as instruções reais de execução para saber se essa memória se refere a VRAM dedicada, memória unificada como a do Apple Silicon ou a uma configuração que também utiliza parte da RAM do sistema.\n\nQuanto maior o contexto, maior também será o cache KV. Portanto, a simples especificação de suporte a 131.072 tokens não permite concluir que o comprimento máximo estará sempre disponível em um ambiente com 24GB.\n\n## Por que foi projetado como um agente de IA local\n\nO agente visado pelo Muse Glimmer é diferente de um chatbot que responde uma vez a uma pergunta e encerra a interação. Um fluxo de trabalho típico é o seguinte.\n\n1. Interpreta o objetivo e as restrições do usuário.\n2. Planeja as subtarefas necessárias para a conclusão.\n3. Aciona pesquisa de arquivos, funções, terminal ou ferramentas de navegador.\n4. Lê os resultados da execução e as mensagens de erro.\n5. Modifica o plano ou o código.\n6. Executa novamente ferramentas de teste ou verificação.\n7. Repete o processo até atender aos critérios de conclusão.\n\nPor exemplo, em uma tarefa de correção de erros de um projeto, análise do código-fonte, execução de comandos, leitura de logs, alteração de código, testes e novas correções acontecem de forma contínua. Como a inferência do modelo se repete em cada etapa, são importantes não apenas a velocidade de resposta, mas também a precisão das chamadas de ferramentas, a capacidade de recuperação de falhas e a manutenção do estado.\n\n## Método de treinamento e capacidades de agente\n\nSegundo o material fornecido, o Muse Glimmer foi pré-treinado por meio de destilação, utilizando os resultados de um modelo professor maior chamado Muse Spark. Posteriormente, foram adicionados dados para contextos longos e tarefas de agentes, e o pós-treinamento teria utilizado aprendizado supervisionado, destilação on-policy e aprendizado por reforço.\n\nO papel geral de cada método pode ser entendido da seguinte forma.\n\n- **Destilação:** treina um modelo menor para imitar as saídas ou os comportamentos de um modelo professor maior.\n- **Aprendizado supervisionado:** fornece respostas, chamadas de função ou processos de trabalho desejáveis como exemplos corretos.\n- **Aprendizado on-policy:** corrige erros com base nas trajetórias de ações realmente geradas pelo modelo atual.\n- **Aprendizado por reforço:** otimiza recompensas como sucesso da tarefa, uso correto de ferramentas e cumprimento de regras de segurança.\n\nEsses procedimentos de treinamento não garantem automaticamente a taxa de sucesso do agente. O escopo dos dados de treinamento, o ambiente de avaliação, as definições das ferramentas e o sandbox de execução exercem grande influência sobre os resultados.\n\n## Recursos multimodais e áreas de aplicação\n\nO Muse Glimmer foi apresentado como um modelo multimodal que compreende entradas de imagem além de texto. As entradas e os casos de uso esperados são os seguintes.\n\n| Entrada visual | Exemplo de tarefa possível |\n|---|---|\n| Captura de tela do PC | Interpretar mensagens de erro ou o estado da UI |\n| Imagem de documento | Extrair e resumir o conteúdo de tabelas, parágrafos e formulários |\n| Gráficos e diagramas | Ler e explicar eixos, legendas e tendências |\n| Tela de GUI | Identificar botões e campos de entrada para planejar a próxima ação |\n| Tela de ferramenta de desenvolvimento | Analisar a saída do terminal ou o estado do depurador |\n| Vários arquivos e imagens | Comparar documentos e manter registros de tarefas de longa duração |\n\nA compreensão visual e a operação real de um computador são recursos distintos. Mesmo que o modelo interprete a tela, é necessário um runtime de agente, uma interface de acessibilidade ou uma ferramenta de automação separada para controlar o mouse ou o teclado.\n\n## DFlash e Speculative Decoding\n\nModelos de linguagem autorregressivos geralmente calculam o próximo token de forma sequencial com base nos tokens já gerados. O Speculative Decoding funciona fazendo com que um modelo drafter menor proponha primeiro vários tokens candidatos, que são então verificados de uma só vez pelo modelo principal.\n\nO processo pode ser resumido da seguinte forma.\n\n1. O drafter DFlash propõe um conjunto de tokens com alta probabilidade de aparecer em seguida.\n2. O modelo principal Muse Glimmer verifica os tokens propostos.\n3. Os tokens que correspondem à distribuição do modelo principal são aceitos.\n4. A geração é retomada a partir do ponto de divergência.\n\nQuando se utiliza um procedimento preciso de verificação, é possível reduzir o tempo de geração mantendo a distribuição de saída do modelo principal. No entanto, se a taxa de acerto do drafter for baixa ou a largura de banda da memória for insuficiente, a aceleração pode ficar abaixo do esperado.\n\n## Velocidades de geração apresentadas no material fornecido\n\nOs números abaixo foram apresentados como resultados de medições internas da Meta com o drafter DFlash aplicado ao K-Quant-17GB. Eles não constituem um benchmark independente, e há limitações para comparações diretas quando não são informados a configuração do hardware, o prompt, o comprimento do contexto, o runtime e as condições de energia.\n\n| Hardware | Velocidade básica | Com DFlash | Melhoria apresentada |\n|---|---:|---:|---:|\n| NVIDIA GeForce RTX 5090 | 74,9 tokens/segundo | 233,4 tokens/segundo | Cerca de 3,1 vezes |\n| Apple M5 Max | 26,6 tokens/segundo | 50,2 tokens/segundo | Cerca de 1,8 vez |\n| Apple M4 Max | 23,7 tokens/segundo | 37,8 tokens/segundo | Cerca de 1,5 vez |\n\nComo os agentes realizam várias inferências e aguardam ferramentas externas, a velocidade de geração de tokens não corresponde necessariamente ao tempo total da tarefa. O tempo real de conclusão também inclui a velocidade de processamento do prompt, entrada e saída de arquivos, execução de código, acesso à rede e quantidade de novas tentativas das ferramentas.\n\n## Como interpretar os resultados de benchmarks\n\nO material fornecido compara o Muse Glimmer com Gemma 4 31B e Qwen 3.6 27B e apresenta os seguintes resultados.\n\n| Benchmark | Muse Glimmer | Gemma 4 31B | Qwen 3.6 27B |\n|---|---:|---:|---:|\n| MCP Atlas | 75,5 | 54,2 | 62,5 |\n| DeepSearch QA | 74,6 | Nenhum número no material | Nenhum número no material |\n\nAo mesmo tempo, foi informado que o Qwen 3.6 27B obteve resultados superiores aos do Muse Glimmer no OSWorld Verified, TerminalBench 2.1 e SWE-bench Verified. Isso significa que avaliações específicas para cada finalidade são mais importantes do que uma única pontuação média.\n\nAo analisar benchmarks, é necessário verificar os seguintes pontos.\n\n- Foram utilizadas a mesma precisão do modelo e as mesmas condições de quantização?\n- O número de chamadas de ferramentas e os limites de tempo eram iguais?\n- O prompt do agente e o código de orquestração foram divulgados?\n- A resolução das imagens e o contexto máximo eram iguais?\n- Foram fornecidas a média e a variância de várias execuções?\n- Foi verificada a possibilidade de os dados de avaliação estarem incluídos nos dados de treinamento?\n- As tarefas que falharam não foram corrigidas ou reiniciadas por uma pessoa?\n\nSegundo o material fornecido, na média de 15 benchmarks, a redução de desempenho do K-Quant-Dynamic em relação ao original foi medida em cerca de 0,2%, enquanto a do K-Quant-17GB foi de cerca de 1%. Esses números também foram apresentados como valores de avaliações internas da Meta, e a queda em cada tarefa pode ser diferente da média.\n\n## Benefícios e limitações da execução local para a privacidade\n\nUma configuração totalmente local ajuda a criar um sistema que não envia código-fonte, documentos internos, capturas de tela e conteúdo de bancos de dados para APIs externas de LLM. Ela também oferece as vantagens de poder ser usada em redes fechadas e de evitar cobranças por token de APIs externas.\n\nNo entanto, o simples fato de o arquivo do modelo estar no dispositivo local não significa que todo o fluxo de dados permaneça local. Os componentes a seguir podem acessar serviços externos.\n\n- Pesquisa na web ou ferramentas de navegador remoto\n- Telemetria de erros e análise de uso\n- Extensões e plugins de agentes\n- Repositórios de documentos baseados em nuvem\n- Gerenciadores de pacotes e repositórios de código\n- Serviços remotos de embeddings, pesquisa ou avaliação\n\nEm organizações que lidam com dados sensíveis, é necessário verificar os logs de rede e os processos em execução, além de revisar os caminhos de dados de todas as ferramentas conectadas, não apenas do runtime do modelo.\n\n## Riscos de segurança dos agentes locais e medidas de proteção\n\nA IA local pode reduzir os riscos de transmissão, mas os riscos decorrentes das permissões do sistema podem até aumentar. É preciso ter atenção especial à injeção indireta de prompt, na qual instruções ocultas em documentos externos ou páginas da web alteram o objetivo original do agente.\n\nOs métodos de proteção recomendados são os seguintes.\n\n- Execute primeiro em um espaço de trabalho somente para leitura.\n- Permita acesso apenas às pastas necessárias, e não a todo o diretório pessoal.\n- Exija aprovação humana para exclusões, sobrescritas, transferências de dinheiro e implantações.\n- Bloqueie privilégios administrativos e o acesso às pastas essenciais do sistema operacional.\n- Não insira chaves secretas nem tokens de autenticação diretamente no contexto do modelo.\n- Aplique uma lista de permissões e limites de tempo de execução aos comandos do terminal.\n- Trate frases de documentos externos como dados não confiáveis.\n- Crie um snapshot ou commit de controle de versão antes de fazer alterações.\n- Registre todas as chamadas de ferramentas e alterações de arquivos em logs de auditoria.\n- Faça testes em contêineres ou máquinas virtuais separados do ambiente real de produção.\n\nNos setores médico, financeiro, jurídico, de defesa e público, o processamento local por si só não garante a conformidade regulatória. Também são necessários controle de acesso, retenção de registros, aprovação dos responsáveis, classificação de dados e validação do modelo.\n\n## O que significa a disponibilização sob Apache 2.0\n\nO material fornecido afirma que os pesos do Muse Glimmer foram disponibilizados sob a Apache License 2.0. A Apache 2.0 é, em geral, uma licença permissiva que autoriza uso, modificação, distribuição e uso comercial, além de incluir cláusulas expressas sobre patentes. Na redistribuição, é necessário cumprir condições como manter uma cópia da licença, preservar avisos de direitos autorais e indicar as alterações realizadas.\n\nNo entanto, ao usar o modelo na prática, é necessário verificar separadamente os seguintes pontos.\n\n- Se cada arquivo do modelo está realmente sujeito à Apache 2.0\n- Se há restrições adicionais de uso no cartão do modelo ou no repositório\n- Se o código incluído e o tokenizador utilizam a mesma licença\n- Se o codificador de visão e o modelo drafter têm condições específicas\n- Se direitos de marca e direitos sobre dados de terceiros estão incluídos no escopo da autorização\n\nA disponibilização dos pesos não significa que todo o processo de treinamento seja de código aberto. Segundo o material fornecido, o conjunto completo de dados de treinamento e todo o código de treinamento não foram divulgados. Portanto, embora o Muse Glimmer possa ser chamado de modelo de pesos abertos, não se deve concluir que seja um modelo de código aberto completo, cujo processo integral de treinamento pode ser reproduzido.\n\n## Checklist antes da adoção\n\nAo avaliar o produto, os resultados que reproduzem seu próprio trabalho são mais importantes do que a velocidade máxima divulgada no material promocional.\n\n1. Verifique a entidade oficial responsável pela distribuição e o repositório do modelo.\n2. Consulte no cartão do modelo a arquitetura, o contexto, os idiomas compatíveis e os formatos de entrada.\n3. Peça à equipe jurídica que analise o arquivo LICENSE e os termos de uso adicionais.\n4. Meça a memória máxima incluindo o modelo, o cache KV, o codificador de visão e o drafter.\n5. Avalie a precisão, a taxa de sucesso das ferramentas e a taxa de recuperação de falhas com documentos e códigos reais.\n6. Meça a velocidade de processamento da entrada e o aumento do uso de memória em contextos longos.\n7. Bloqueie a rede e verifique se todos os recursos realmente funcionam de forma local.\n8. Realize testes de ataque usando injeção de prompt e arquivos maliciosos.\n9. Aplique aprovação humana e backups automáticos a alterações importantes.\n10. Compare a diferença de qualidade por tarefa entre as versões quantizadas e o original em BF16.\n\n## Avaliação geral\n\nO diferencial do Muse Glimmer não está na alegação de ser um modelo de uso geral com as maiores pontuações em todos os benchmarks, mas em seu projeto de adaptar um modelo multimodal com cerca de 30 bilhões de parâmetros e recursos de agente de longa duração ao hardware de consumo. Se a quantização de 4 bits, o contexto longo, a aceleração DFlash e a licença permissiva forem disponibilizados conforme os materiais oficiais, ele poderá ser uma opção relevante para programação local, análise de documentos e automação em redes fechadas.\n\nPor outro lado, as expressões 24GB ou 32GB não garantem que todos os recursos e o contexto máximo do modelo funcionarão sem problemas em qualquer dispositivo. Até que o cartão oficial do modelo e benchmarks reproduzíveis sejam confirmados, é necessário distinguir os números de velocidade e qualidade como alegações baseadas em medições internas da Meta e adotar uma abordagem que avalie memória, segurança e precisão em cargas de trabalho reais.","content_html":"\u003cp\u003eO Meta Muse Glimmer foi apresentado como um modelo com cerca de 30 bilhões de parâmetros, projetado para ser executado em PCs pessoais ou notebooks de alto desempenho e servir de base para agentes de IA locais capazes de operar por longos períodos. Seu objetivo central vai além da geração de texto: compreender imagens e telas e usar ferramentas como arquivos, funções e terminal em várias etapas.\u003c/p\u003e\n\u003cp\u003eAs especificações do produto e os números de benchmarks deste artigo foram organizados com base nos anúncios da Meta citados no material fornecido. Como não foram disponibilizadas URLs diretas do artigo original nem do cartão oficial do modelo, os números não devem ser interpretados como resultados verificados de forma independente.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#principais-especifica%C3%A7%C3%B5es-do-muse-glimmer\" class=\"anchor\" id=\"principais-especificações-do-muse-glimmer\"\u003e\u003c/a\u003ePrincipais especificações do Muse Glimmer\u003c/h2\u003e\n\u003cp\u003eAs principais especificações descritas no material fornecido são as seguintes.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eItem\u003c/th\u003e\n\u003cth\u003eConteúdo apresentado\u003c/th\u003e\n\u003cth\u003eCuidados na interpretação\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eEscala do modelo\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eCerca de 30 bilhões de parâmetros\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eÉ necessário consultar o cartão do modelo para verificar os parâmetros realmente ativos e os detalhes da arquitetura\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eFormatos de entrada\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eTexto e imagens\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eÉ necessário verificar separadamente a resolução de imagem compatível, o número de quadros e o custo dos tokens de visão\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eContexto\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eMáximo de pelo menos 131.072 tokens\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eA precisão e o uso de memória no comprimento máximo podem ser diferentes dos observados com entradas curtas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eIdiomas\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003ePelo menos 100 idiomas\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eIsso não significa que a qualidade seja igual em todos os idiomas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eVersões de baixa precisão\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eK-Quant-17GB, K-Quant-Dynamic\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eA capacidade incluída no nome deve ser diferenciada da memória total necessária para execução\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003ePrincipais usos\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eProgramação, automação de desktop, chamadas de função, análise de documentos e avaliação\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eOs recursos reais dependem do runtime conectado e das políticas de permissão\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eMétodo de aceleração\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eSpeculative Decoding com o drafter DFlash\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eO nível de aceleração varia conforme o hardware e o comprimento da entrada\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eFormato de disponibilização\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eBF16, quantização de 4 bits e modelo drafter\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eÉ necessário verificar no repositório os arquivos fornecidos e os runtimes compatíveis\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eLicença\u003c/td\u003e\n\u003ctd data-label=\"Conteúdo apresentado\"\u003eApresentada como Apache License 2.0\u003c/td\u003e\n\u003ctd data-label=\"Cuidados na interpretação\"\u003eÉ necessário verificar a LICENSE real do repositório do modelo e eventuais condições adicionais de uso\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003ch2\u003e\n\u003ca href=\"#como-30-bilh%C3%B5es-de-par%C3%A2metros-funcionam-em-24gb\" class=\"anchor\" id=\"como-30-bilhões-de-parâmetros-funcionam-em-24gb\"\u003e\u003c/a\u003eComo 30 bilhões de parâmetros funcionam em 24GB\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#c%C3%A1lculo-simples-da-mem%C3%B3ria-dos-pesos\" class=\"anchor\" id=\"cálculo-simples-da-memória-dos-pesos\"\u003e\u003c/a\u003eCálculo simples da memória dos pesos\u003c/h3\u003e\n\u003cp\u003eConsiderando apenas os pesos do modelo, o espaço de armazenamento necessário pode ser calculado aproximadamente da seguinte forma.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eBF16 ou FP16: 30 bilhões × 2 bytes = cerca de 60GB\u003c/li\u003e\n\u003cli\u003e8 bits: 30 bilhões × 1 byte = cerca de 30GB\u003c/li\u003e\n\u003cli\u003e4 bits: 30 bilhões × 0,5 byte = cerca de 15GB\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eAos pesos de 4 bits são acrescentados escalas de quantização, metadados, alinhamento e overhead do runtime. Por isso, o pacote de pesos com cerca de 17GB mencionado no material fornecido pode ser maior do que os 15GB teóricos.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#mem%C3%B3ria-necess%C3%A1ria-al%C3%A9m-dos-pesos\" class=\"anchor\" id=\"memória-necessária-além-dos-pesos\"\u003e\u003c/a\u003eMemória necessária além dos pesos\u003c/h3\u003e\n\u003cp\u003eA existência de um arquivo de modelo de 17GB não significa que ele possa ser executado diretamente em um dispositivo com 17GB de memória. Na inferência real, os componentes a seguir também ocupam espaço.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eCache KV que preserva o histórico de entrada e saída\u003c/li\u003e\n\u003cli\u003eCodificador de visão que processa entradas de imagem\u003c/li\u003e\n\u003cli\u003eAtivações intermediárias e espaço de trabalho do runtime\u003c/li\u003e\n\u003cli\u003eModelos auxiliares, como o drafter DFlash\u003c/li\u003e\n\u003cli\u003eUso do sistema operacional, do desktop e de outros aplicativos\u003c/li\u003e\n\u003cli\u003eBuffers e espaço de cópia entre a GPU e a memória do sistema\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eO material fornecido descreve o K-Quant-17GB como uma versão destinada a ambientes com cerca de 24GB, e o K-Quant-Dynamic como uma versão para ambientes com cerca de 32GB. No entanto, é necessário consultar as instruções reais de execução para saber se essa memória se refere a VRAM dedicada, memória unificada como a do Apple Silicon ou a uma configuração que também utiliza parte da RAM do sistema.\u003c/p\u003e\n\u003cp\u003eQuanto maior o contexto, maior também será o cache KV. Portanto, a simples especificação de suporte a 131.072 tokens não permite concluir que o comprimento máximo estará sempre disponível em um ambiente com 24GB.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#por-que-foi-projetado-como-um-agente-de-ia-local\" class=\"anchor\" id=\"por-que-foi-projetado-como-um-agente-de-ia-local\"\u003e\u003c/a\u003ePor que foi projetado como um agente de IA local\u003c/h2\u003e\n\u003cp\u003eO agente visado pelo Muse Glimmer é diferente de um chatbot que responde uma vez a uma pergunta e encerra a interação. Um fluxo de trabalho típico é o seguinte.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eInterpreta o objetivo e as restrições do usuário.\u003c/li\u003e\n\u003cli\u003ePlaneja as subtarefas necessárias para a conclusão.\u003c/li\u003e\n\u003cli\u003eAciona pesquisa de arquivos, funções, terminal ou ferramentas de navegador.\u003c/li\u003e\n\u003cli\u003eLê os resultados da execução e as mensagens de erro.\u003c/li\u003e\n\u003cli\u003eModifica o plano ou o código.\u003c/li\u003e\n\u003cli\u003eExecuta novamente ferramentas de teste ou verificação.\u003c/li\u003e\n\u003cli\u003eRepete o processo até atender aos critérios de conclusão.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003ePor exemplo, em uma tarefa de correção de erros de um projeto, análise do código-fonte, execução de comandos, leitura de logs, alteração de código, testes e novas correções acontecem de forma contínua. Como a inferência do modelo se repete em cada etapa, são importantes não apenas a velocidade de resposta, mas também a precisão das chamadas de ferramentas, a capacidade de recuperação de falhas e a manutenção do estado.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#m%C3%A9todo-de-treinamento-e-capacidades-de-agente\" class=\"anchor\" id=\"método-de-treinamento-e-capacidades-de-agente\"\u003e\u003c/a\u003eMétodo de treinamento e capacidades de agente\u003c/h2\u003e\n\u003cp\u003eSegundo o material fornecido, o Muse Glimmer foi pré-treinado por meio de destilação, utilizando os resultados de um modelo professor maior chamado Muse Spark. Posteriormente, foram adicionados dados para contextos longos e tarefas de agentes, e o pós-treinamento teria utilizado aprendizado supervisionado, destilação on-policy e aprendizado por reforço.\u003c/p\u003e\n\u003cp\u003eO papel geral de cada método pode ser entendido da seguinte forma.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eDestilação:\u003c/strong\u003e treina um modelo menor para imitar as saídas ou os comportamentos de um modelo professor maior.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAprendizado supervisionado:\u003c/strong\u003e fornece respostas, chamadas de função ou processos de trabalho desejáveis como exemplos corretos.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAprendizado on-policy:\u003c/strong\u003e corrige erros com base nas trajetórias de ações realmente geradas pelo modelo atual.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAprendizado por reforço:\u003c/strong\u003e otimiza recompensas como sucesso da tarefa, uso correto de ferramentas e cumprimento de regras de segurança.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEsses procedimentos de treinamento não garantem automaticamente a taxa de sucesso do agente. O escopo dos dados de treinamento, o ambiente de avaliação, as definições das ferramentas e o sandbox de execução exercem grande influência sobre os resultados.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#recursos-multimodais-e-%C3%A1reas-de-aplica%C3%A7%C3%A3o\" class=\"anchor\" id=\"recursos-multimodais-e-áreas-de-aplicação\"\u003e\u003c/a\u003eRecursos multimodais e áreas de aplicação\u003c/h2\u003e\n\u003cp\u003eO Muse Glimmer foi apresentado como um modelo multimodal que compreende entradas de imagem além de texto. As entradas e os casos de uso esperados são os seguintes.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eEntrada visual\u003c/th\u003e\n\u003cth\u003eExemplo de tarefa possível\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eCaptura de tela do PC\u003c/td\u003e\n\u003ctd data-label=\"Exemplo de tarefa possível\"\u003eInterpretar mensagens de erro ou o estado da UI\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eImagem de documento\u003c/td\u003e\n\u003ctd data-label=\"Exemplo de tarefa possível\"\u003eExtrair e resumir o conteúdo de tabelas, parágrafos e formulários\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eGráficos e diagramas\u003c/td\u003e\n\u003ctd data-label=\"Exemplo de tarefa possível\"\u003eLer e explicar eixos, legendas e tendências\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eTela de GUI\u003c/td\u003e\n\u003ctd data-label=\"Exemplo de tarefa possível\"\u003eIdentificar botões e campos de entrada para planejar a próxima ação\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eTela de ferramenta de desenvolvimento\u003c/td\u003e\n\u003ctd data-label=\"Exemplo de tarefa possível\"\u003eAnalisar a saída do terminal ou o estado do depurador\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eVários arquivos e imagens\u003c/td\u003e\n\u003ctd data-label=\"Exemplo de tarefa possível\"\u003eComparar documentos e manter registros de tarefas de longa duração\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eA compreensão visual e a operação real de um computador são recursos distintos. Mesmo que o modelo interprete a tela, é necessário um runtime de agente, uma interface de acessibilidade ou uma ferramenta de automação separada para controlar o mouse ou o teclado.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#dflash-e-speculative-decoding\" class=\"anchor\" id=\"dflash-e-speculative-decoding\"\u003e\u003c/a\u003eDFlash e Speculative Decoding\u003c/h2\u003e\n\u003cp\u003eModelos de linguagem autorregressivos geralmente calculam o próximo token de forma sequencial com base nos tokens já gerados. O Speculative Decoding funciona fazendo com que um modelo drafter menor proponha primeiro vários tokens candidatos, que são então verificados de uma só vez pelo modelo principal.\u003c/p\u003e\n\u003cp\u003eO processo pode ser resumido da seguinte forma.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eO drafter DFlash propõe um conjunto de tokens com alta probabilidade de aparecer em seguida.\u003c/li\u003e\n\u003cli\u003eO modelo principal Muse Glimmer verifica os tokens propostos.\u003c/li\u003e\n\u003cli\u003eOs tokens que correspondem à distribuição do modelo principal são aceitos.\u003c/li\u003e\n\u003cli\u003eA geração é retomada a partir do ponto de divergência.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eQuando se utiliza um procedimento preciso de verificação, é possível reduzir o tempo de geração mantendo a distribuição de saída do modelo principal. No entanto, se a taxa de acerto do drafter for baixa ou a largura de banda da memória for insuficiente, a aceleração pode ficar abaixo do esperado.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#velocidades-de-gera%C3%A7%C3%A3o-apresentadas-no-material-fornecido\" class=\"anchor\" id=\"velocidades-de-geração-apresentadas-no-material-fornecido\"\u003e\u003c/a\u003eVelocidades de geração apresentadas no material fornecido\u003c/h2\u003e\n\u003cp\u003eOs números abaixo foram apresentados como resultados de medições internas da Meta com o drafter DFlash aplicado ao K-Quant-17GB. Eles não constituem um benchmark independente, e há limitações para comparações diretas quando não são informados a configuração do hardware, o prompt, o comprimento do contexto, o runtime e as condições de energia.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eHardware\u003c/th\u003e\n\u003cth\u003eVelocidade básica\u003c/th\u003e\n\u003cth\u003eCom DFlash\u003c/th\u003e\n\u003cth\u003eMelhoria apresentada\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eNVIDIA GeForce RTX 5090\u003c/td\u003e\n\u003ctd data-label=\"Velocidade básica\"\u003e74,9 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Com DFlash\"\u003e233,4 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Melhoria apresentada\"\u003eCerca de 3,1 vezes\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eApple M5 Max\u003c/td\u003e\n\u003ctd data-label=\"Velocidade básica\"\u003e26,6 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Com DFlash\"\u003e50,2 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Melhoria apresentada\"\u003eCerca de 1,8 vez\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eApple M4 Max\u003c/td\u003e\n\u003ctd data-label=\"Velocidade básica\"\u003e23,7 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Com DFlash\"\u003e37,8 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Melhoria apresentada\"\u003eCerca de 1,5 vez\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eComo os agentes realizam várias inferências e aguardam ferramentas externas, a velocidade de geração de tokens não corresponde necessariamente ao tempo total da tarefa. O tempo real de conclusão também inclui a velocidade de processamento do prompt, entrada e saída de arquivos, execução de código, acesso à rede e quantidade de novas tentativas das ferramentas.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#como-interpretar-os-resultados-de-benchmarks\" class=\"anchor\" id=\"como-interpretar-os-resultados-de-benchmarks\"\u003e\u003c/a\u003eComo interpretar os resultados de benchmarks\u003c/h2\u003e\n\u003cp\u003eO material fornecido compara o Muse Glimmer com Gemma 4 31B e Qwen 3.6 27B e apresenta os seguintes resultados.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eBenchmark\u003c/th\u003e\n\u003cth\u003eMuse Glimmer\u003c/th\u003e\n\u003cth\u003eGemma 4 31B\u003c/th\u003e\n\u003cth\u003eQwen 3.6 27B\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Benchmark\"\u003eMCP Atlas\u003c/td\u003e\n\u003ctd data-label=\"Muse Glimmer\"\u003e75,5\u003c/td\u003e\n\u003ctd data-label=\"Gemma 4 31B\"\u003e54,2\u003c/td\u003e\n\u003ctd data-label=\"Qwen 3.6 27B\"\u003e62,5\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Benchmark\"\u003eDeepSearch QA\u003c/td\u003e\n\u003ctd data-label=\"Muse Glimmer\"\u003e74,6\u003c/td\u003e\n\u003ctd data-label=\"Gemma 4 31B\"\u003eNenhum número no material\u003c/td\u003e\n\u003ctd data-label=\"Qwen 3.6 27B\"\u003eNenhum número no material\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eAo mesmo tempo, foi informado que o Qwen 3.6 27B obteve resultados superiores aos do Muse Glimmer no OSWorld Verified, TerminalBench 2.1 e SWE-bench Verified. Isso significa que avaliações específicas para cada finalidade são mais importantes do que uma única pontuação média.\u003c/p\u003e\n\u003cp\u003eAo analisar benchmarks, é necessário verificar os seguintes pontos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eForam utilizadas a mesma precisão do modelo e as mesmas condições de quantização?\u003c/li\u003e\n\u003cli\u003eO número de chamadas de ferramentas e os limites de tempo eram iguais?\u003c/li\u003e\n\u003cli\u003eO prompt do agente e o código de orquestração foram divulgados?\u003c/li\u003e\n\u003cli\u003eA resolução das imagens e o contexto máximo eram iguais?\u003c/li\u003e\n\u003cli\u003eForam fornecidas a média e a variância de várias execuções?\u003c/li\u003e\n\u003cli\u003eFoi verificada a possibilidade de os dados de avaliação estarem incluídos nos dados de treinamento?\u003c/li\u003e\n\u003cli\u003eAs tarefas que falharam não foram corrigidas ou reiniciadas por uma pessoa?\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eSegundo o material fornecido, na média de 15 benchmarks, a redução de desempenho do K-Quant-Dynamic em relação ao original foi medida em cerca de 0,2%, enquanto a do K-Quant-17GB foi de cerca de 1%. Esses números também foram apresentados como valores de avaliações internas da Meta, e a queda em cada tarefa pode ser diferente da média.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#benef%C3%ADcios-e-limita%C3%A7%C3%B5es-da-execu%C3%A7%C3%A3o-local-para-a-privacidade\" class=\"anchor\" id=\"benefícios-e-limitações-da-execução-local-para-a-privacidade\"\u003e\u003c/a\u003eBenefícios e limitações da execução local para a privacidade\u003c/h2\u003e\n\u003cp\u003eUma configuração totalmente local ajuda a criar um sistema que não envia código-fonte, documentos internos, capturas de tela e conteúdo de bancos de dados para APIs externas de LLM. Ela também oferece as vantagens de poder ser usada em redes fechadas e de evitar cobranças por token de APIs externas.\u003c/p\u003e\n\u003cp\u003eNo entanto, o simples fato de o arquivo do modelo estar no dispositivo local não significa que todo o fluxo de dados permaneça local. Os componentes a seguir podem acessar serviços externos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003ePesquisa na web ou ferramentas de navegador remoto\u003c/li\u003e\n\u003cli\u003eTelemetria de erros e análise de uso\u003c/li\u003e\n\u003cli\u003eExtensões e plugins de agentes\u003c/li\u003e\n\u003cli\u003eRepositórios de documentos baseados em nuvem\u003c/li\u003e\n\u003cli\u003eGerenciadores de pacotes e repositórios de código\u003c/li\u003e\n\u003cli\u003eServiços remotos de embeddings, pesquisa ou avaliação\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEm organizações que lidam com dados sensíveis, é necessário verificar os logs de rede e os processos em execução, além de revisar os caminhos de dados de todas as ferramentas conectadas, não apenas do runtime do modelo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#riscos-de-seguran%C3%A7a-dos-agentes-locais-e-medidas-de-prote%C3%A7%C3%A3o\" class=\"anchor\" id=\"riscos-de-segurança-dos-agentes-locais-e-medidas-de-proteção\"\u003e\u003c/a\u003eRiscos de segurança dos agentes locais e medidas de proteção\u003c/h2\u003e\n\u003cp\u003eA IA local pode reduzir os riscos de transmissão, mas os riscos decorrentes das permissões do sistema podem até aumentar. É preciso ter atenção especial à injeção indireta de prompt, na qual instruções ocultas em documentos externos ou páginas da web alteram o objetivo original do agente.\u003c/p\u003e\n\u003cp\u003eOs métodos de proteção recomendados são os seguintes.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eExecute primeiro em um espaço de trabalho somente para leitura.\u003c/li\u003e\n\u003cli\u003ePermita acesso apenas às pastas necessárias, e não a todo o diretório pessoal.\u003c/li\u003e\n\u003cli\u003eExija aprovação humana para exclusões, sobrescritas, transferências de dinheiro e implantações.\u003c/li\u003e\n\u003cli\u003eBloqueie privilégios administrativos e o acesso às pastas essenciais do sistema operacional.\u003c/li\u003e\n\u003cli\u003eNão insira chaves secretas nem tokens de autenticação diretamente no contexto do modelo.\u003c/li\u003e\n\u003cli\u003eAplique uma lista de permissões e limites de tempo de execução aos comandos do terminal.\u003c/li\u003e\n\u003cli\u003eTrate frases de documentos externos como dados não confiáveis.\u003c/li\u003e\n\u003cli\u003eCrie um snapshot ou commit de controle de versão antes de fazer alterações.\u003c/li\u003e\n\u003cli\u003eRegistre todas as chamadas de ferramentas e alterações de arquivos em logs de auditoria.\u003c/li\u003e\n\u003cli\u003eFaça testes em contêineres ou máquinas virtuais separados do ambiente real de produção.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eNos setores médico, financeiro, jurídico, de defesa e público, o processamento local por si só não garante a conformidade regulatória. Também são necessários controle de acesso, retenção de registros, aprovação dos responsáveis, classificação de dados e validação do modelo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#o-que-significa-a-disponibiliza%C3%A7%C3%A3o-sob-apache-20\" class=\"anchor\" id=\"o-que-significa-a-disponibilização-sob-apache-20\"\u003e\u003c/a\u003eO que significa a disponibilização sob Apache 2.0\u003c/h2\u003e\n\u003cp\u003eO material fornecido afirma que os pesos do Muse Glimmer foram disponibilizados sob a Apache License 2.0. A Apache 2.0 é, em geral, uma licença permissiva que autoriza uso, modificação, distribuição e uso comercial, além de incluir cláusulas expressas sobre patentes. Na redistribuição, é necessário cumprir condições como manter uma cópia da licença, preservar avisos de direitos autorais e indicar as alterações realizadas.\u003c/p\u003e\n\u003cp\u003eNo entanto, ao usar o modelo na prática, é necessário verificar separadamente os seguintes pontos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eSe cada arquivo do modelo está realmente sujeito à Apache 2.0\u003c/li\u003e\n\u003cli\u003eSe há restrições adicionais de uso no cartão do modelo ou no repositório\u003c/li\u003e\n\u003cli\u003eSe o código incluído e o tokenizador utilizam a mesma licença\u003c/li\u003e\n\u003cli\u003eSe o codificador de visão e o modelo drafter têm condições específicas\u003c/li\u003e\n\u003cli\u003eSe direitos de marca e direitos sobre dados de terceiros estão incluídos no escopo da autorização\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eA disponibilização dos pesos não significa que todo o processo de treinamento seja de código aberto. Segundo o material fornecido, o conjunto completo de dados de treinamento e todo o código de treinamento não foram divulgados. Portanto, embora o Muse Glimmer possa ser chamado de modelo de pesos abertos, não se deve concluir que seja um modelo de código aberto completo, cujo processo integral de treinamento pode ser reproduzido.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#checklist-antes-da-ado%C3%A7%C3%A3o\" class=\"anchor\" id=\"checklist-antes-da-adoção\"\u003e\u003c/a\u003eChecklist antes da adoção\u003c/h2\u003e\n\u003cp\u003eAo avaliar o produto, os resultados que reproduzem seu próprio trabalho são mais importantes do que a velocidade máxima divulgada no material promocional.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eVerifique a entidade oficial responsável pela distribuição e o repositório do modelo.\u003c/li\u003e\n\u003cli\u003eConsulte no cartão do modelo a arquitetura, o contexto, os idiomas compatíveis e os formatos de entrada.\u003c/li\u003e\n\u003cli\u003ePeça à equipe jurídica que analise o arquivo LICENSE e os termos de uso adicionais.\u003c/li\u003e\n\u003cli\u003eMeça a memória máxima incluindo o modelo, o cache KV, o codificador de visão e o drafter.\u003c/li\u003e\n\u003cli\u003eAvalie a precisão, a taxa de sucesso das ferramentas e a taxa de recuperação de falhas com documentos e códigos reais.\u003c/li\u003e\n\u003cli\u003eMeça a velocidade de processamento da entrada e o aumento do uso de memória em contextos longos.\u003c/li\u003e\n\u003cli\u003eBloqueie a rede e verifique se todos os recursos realmente funcionam de forma local.\u003c/li\u003e\n\u003cli\u003eRealize testes de ataque usando injeção de prompt e arquivos maliciosos.\u003c/li\u003e\n\u003cli\u003eAplique aprovação humana e backups automáticos a alterações importantes.\u003c/li\u003e\n\u003cli\u003eCompare a diferença de qualidade por tarefa entre as versões quantizadas e o original em BF16.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#avalia%C3%A7%C3%A3o-geral\" class=\"anchor\" id=\"avaliação-geral\"\u003e\u003c/a\u003eAvaliação geral\u003c/h2\u003e\n\u003cp\u003eO diferencial do Muse Glimmer não está na alegação de ser um modelo de uso geral com as maiores pontuações em todos os benchmarks, mas em seu projeto de adaptar um modelo multimodal com cerca de 30 bilhões de parâmetros e recursos de agente de longa duração ao hardware de consumo. Se a quantização de 4 bits, o contexto longo, a aceleração DFlash e a licença permissiva forem disponibilizados conforme os materiais oficiais, ele poderá ser uma opção relevante para programação local, análise de documentos e automação em redes fechadas.\u003c/p\u003e\n\u003cp\u003ePor outro lado, as expressões 24GB ou 32GB não garantem que todos os recursos e o contexto máximo do modelo funcionarão sem problemas em qualquer dispositivo. Até que o cartão oficial do modelo e benchmarks reproduzíveis sejam confirmados, é necessário distinguir os números de velocidade e qualidade como alegações baseadas em medições internas da Meta e adotar uma abordagem que avalie memória, segurança e precisão em cargas de trabalho reais.\u003c/p\u003e\n","tags":["Agentes de IA","Meta","Muse Glimmer","IA local","Quantização"],"faqs":[{"question":"Em que o Muse Glimmer difere dos LLMs locais comuns?","answer":"A diferença é que seu principal objetivo são agentes de AI de longa execução que analisam arquivos e telas, chamam ferramentas como funções ou terminais, verificam os resultados e ajustam o planejamento, em vez de chatbots que geram apenas respostas em texto."},{"question":"Um modelo de 30 bilhões de parâmetros realmente funciona com 24GB de memória?","answer":"O material fornecido explica que a versão K-Quant-17GB de 4 bits foi adaptada para um ambiente com cerca de 24GB. No entanto, como a memória necessária varia conforme o tamanho do contexto, a entrada visual, o cache KV, o modelo drafter e o uso de memória pelo sistema operacional, os 24GB não devem ser interpretados como uma especificação mínima garantida para todas as condições de uso."},{"question":"Por que o modelo de 17GB e os 24GB de memória de execução são diferentes?","answer":"17GB é uma expressão que se refere principalmente ao pacote de pesos quantizados. A execução efetiva exige memória adicional para o cache KV, ativações intermediárias, codificador visual, espaço de trabalho do runtime e sistema operacional."},{"question":"É sempre possível usar o contexto de 131,072 tokens?","answer":"Mesmo que o modelo seja compatível com esse tamanho, o máximo efetivo pode ser limitado pelo runtime, pela memória, pela precisão do cache KV e pelo volume de entradas de imagem. Também é necessário avaliar separadamente se a precisão da recuperação de informações é mantida no tamanho máximo."},{"question":"O DFlash drafter reduz a qualidade das respostas do modelo?","answer":"O Speculative Decoding foi projetado para que o modelo principal verifique os tokens propostos pelo drafter; portanto, quando implementado corretamente, pode preservar a distribuição de saída do modelo principal. No entanto, se o método de implementação e as configurações de amostragem forem diferentes, os resultados e o grau de aceleração também poderão variar."},{"question":"Ao executar localmente, os dados nunca são enviados para fora?","answer":"Não. Mesmo que o modelo seja local, buscas na web, plugins, repositórios remotos, telemetria ou ferramentas de embeddings em nuvem podem transmitir dados. É necessário verificar a comunicação de rede de toda a configuração do agente."},{"question":"Quais permissões são seguras para conceder a um agente de AI local?","answer":"Recomenda-se conceder permissões mínimas apenas às pastas de trabalho necessárias e executá-lo inicialmente em modo somente leitura. Tarefas de alto risco, como exclusão de arquivos, transmissão externa, instalação de software e implantação, devem exigir aprovação humana."},{"question":"Sendo Apache 2.0, pode ser usado livremente para fins comerciais?","answer":"A Apache 2.0 em si é uma licença permissiva que permite uso comercial, modificação e redistribuição. No entanto, é necessário verificar o LICENSE e o cartão do modelo no repositório oficial para confirmar se essa licença se aplica aos arquivos reais do modelo e se há condições adicionais e componentes de terceiros."},{"question":"O Muse Glimmer é um modelo totalmente de código aberto?","answer":"Segundo o material fornecido, os pesos foram disponibilizados, mas nem todos os dados de treinamento nem todo o código de treinamento foram divulgados. Portanto, é possível descrevê-lo como um modelo de pesos abertos, mas é necessário distinguir se ele é um modelo totalmente de código aberto cujo processo completo de treinamento pode ser reproduzido."},{"question":"É possível confiar integralmente na velocidade e nos benchmarks apresentados pela Meta?","answer":"Medições próprias são úteis como referência inicial, mas não substituem uma verificação independente. São necessários resultados de reprodução usando a mesma quantização, o mesmo runtime, tamanho de contexto, configurações de energia e ferramentas de agente."}],"sources":[{"url":"https://www.apache.org/licenses/LICENSE-2.0","title":"Licença Apache, Versão 2.0","type":"source"},{"url":"https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf","title":"NIST AI 600-1: Estrutura de Gestão de Riscos de Inteligência Artificial — Perfil de Inteligência Artificial Generativa","type":"source"}],"images":[{"id":602,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NzE2MywicHVyIjoiYmxvYl9pZCJ9fQ==--655d2556aee6b63b88d70cffbc019429039bcd2b/ai-7afa8941.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"데이터 블록을 받아 문서·이미지·코드로 처리하는 로컬 AI 노트북 개념도","caption":"노트북에서 로컬 AI가 다양한 데이터를 처리하고 보안 워크플로를 수행하는 모습을 나타낸다.","description":null},"en":{"alt":"Local AI laptop processing data blocks into documents, images, folders, code, and charts","caption":"The diagram depicts a laptop running local AI for multimodal processing and secure workflows.","description":null},"ja":{"alt":"データブロックを文書・画像・コードなどに処理するローカルAI搭載ノートPCの概念図","caption":"ノートPC上のローカルAIが多様なデータを処理し、安全なワークフローを実行する様子を示す。","description":null},"es":{"alt":"Portátil con IA local que procesa bloques de datos en documentos, imágenes, código y gráficos","caption":"El diagrama muestra una IA local en un portátil gestionando datos multimodales y flujos seguros.","description":null},"id":{"alt":"Laptop AI lokal memproses blok data menjadi dokumen, gambar, folder, kode, dan grafik","caption":"Diagram ini menggambarkan AI lokal di laptop yang menangani data multimodal dan alur kerja aman.","description":null},"pt":{"alt":"Notebook com IA local processando blocos de dados em documentos, imagens, códigos e gráficos","caption":"O diagrama mostra uma IA local no notebook gerenciando dados multimodais e fluxos seguros.","description":null},"zh-hant":{"alt":"本機 AI 筆電將資料區塊處理成文件、圖像、資料夾、程式碼與圖表","caption":"示意圖呈現筆電上的本機 AI 處理多模態資料並執行安全工作流程。","description":null},"de":{"alt":"Laptop mit lokaler KI verarbeitet Datenblöcke zu Dokumenten, Bildern, Code und Diagrammen","caption":"Die Grafik zeigt lokale KI auf einem Laptop bei der multimodalen Verarbeitung und sicheren Abläufen.","description":null}}},{"id":603,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NzE2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--febd3177afd7cf52d6fa7bb0e86da563e46d0ffb/ai-34107f0a.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 칩이 표시된 노트북과 보안 방패, 파일, 경고, 성능 계기판을 배치한 일러스트","caption":"노트북에서 실행되는 로컬 AI의 보안, 파일 처리, 최적화 및 성능 측정을 시각화했다.","description":null},"en":{"alt":"Laptop with an AI chip, security shield, files, warnings, and performance gauges","caption":"The illustration visualizes security, file processing, optimization, and performance for local AI on a laptop.","description":null},"ja":{"alt":"AIチップを表示したノートPCと、セキュリティ盾、ファイル、警告、性能メーターの図","caption":"ノートPCで動作するローカルAIの安全性、ファイル処理、最適化、性能測定を表している。","description":null},"es":{"alt":"Portátil con chip de IA, escudo de seguridad, archivos, alertas y medidores de rendimiento","caption":"La ilustración representa la seguridad, el procesamiento, la optimización y el rendimiento de una IA local.","description":null},"id":{"alt":"Laptop dengan cip AI, perisai keamanan, berkas, peringatan, dan pengukur kinerja","caption":"Ilustrasi ini menggambarkan keamanan, pemrosesan berkas, optimasi, dan kinerja AI lokal di laptop.","description":null},"pt":{"alt":"Notebook com chip de IA, escudo de segurança, arquivos, alertas e medidores de desempenho","caption":"A ilustração mostra segurança, processamento de arquivos, otimização e desempenho de IA local no notebook.","description":null},"zh-hant":{"alt":"顯示 AI 晶片的筆電，周圍有安全盾牌、檔案、警告與效能儀表","caption":"插圖呈現筆電本機 AI 的安全性、檔案處理、最佳化與效能測量。","description":null},"de":{"alt":"Laptop mit KI-Chip, Sicherheitsschild, Dateien, Warnsymbolen und Leistungsanzeigen","caption":"Die Illustration zeigt Sicherheit, Dateiverarbeitung, Optimierung und Leistung lokaler KI auf einem Laptop.","description":null}}}],"published_at":"2026-08-12T14:00:06+09:00","updated_at":"2026-08-12T14:00:06+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/meta-muse-glimmer-local-ai-agent-model"}