{"content_id":"vupqjenc6z","slug":"meta-muse-glimmer-local-ai-agent-model","locale":"es","schema_type":"TechArticle","category":"ai_data","category_name":"Datos de IA","title":"Meta Muse Glimmer: claves del modelo de IA local para portátiles con 30.000 millones de parámetros","summary":"Muse Glimmer se presentó como un modelo multimodal orientado a agentes de IA locales capaces de usar herramientas durante largos periodos, cuantificado para ejecutar sus cerca de 30.000 millones de parámetros en hardware de consumo. Sin embargo, las cifras de memoria, velocidad y pruebas de rendimiento citadas en el material proporcionado proceden de mediciones de la propia Meta, por lo que deben verificarse mediante la ficha oficial del modelo y evaluaciones independientes.","author":{"name":"Equipo editorial de Injoys","url":"https://injoys.com/ko/about"},"key_points":["Muse Glimmer aspira a ser un agente de IA de ejecución prolongada que maneja archivos, pantallas y herramientas, más que un simple chatbot local.","Según el material proporcionado, la versión cuantificada a 4 bits se diseñó para ejecutar el sistema completo en entornos con aproximadamente 24 GB o 32 GB de memoria.","La decodificación especulativa mediante DFlash drafter procesa varios tokens candidatos a la vez, sujetos a la verificación del modelo principal.","El procesamiento local puede reducir la transmisión externa de datos, pero no elimina los riesgos de inyección de prompts, permisos excesivos del sistema o daños en archivos.","El rendimiento y la licencia deben evaluarse tras comprobar la ficha del modelo del repositorio oficial, el archivo de licencia real y los resultados de mediciones independientes para cada hardware."],"content_markdown":"Meta Muse Glimmer se presentó como un modelo con aproximadamente 30,000 millones de parámetros diseñado para ejecutarse en un PC personal o un portátil de alto rendimiento y permitir implementar sobre él agentes de IA locales que funcionen durante largos periodos. Su objetivo principal no se limita a la generación de texto, sino que también busca comprender imágenes y pantallas, y utilizar herramientas como archivos, funciones y terminales a lo largo de múltiples pasos.\n\nLas especificaciones del producto y las cifras de los benchmarks de este artículo se han recopilado a partir de los anuncios de Meta citados en los materiales proporcionados. Dado que no se facilitaron las URL directas del artículo original ni de la ficha oficial del modelo, las cifras no deben interpretarse como resultados verificados de forma independiente.\n\n## Especificaciones principales de Muse Glimmer\n\nLas principales especificaciones descritas en los materiales proporcionados son las siguientes.\n\n| Elemento | Información presentada | Aspectos que deben tenerse en cuenta al interpretarla |\n|---|---|---|\n| Tamaño del modelo | Aproximadamente 30,000 millones de parámetros | Es necesario consultar la ficha del modelo para conocer los parámetros activos reales y la arquitectura detallada |\n| Formatos de entrada | Texto e imágenes | Es necesario comprobar por separado la resolución de imagen compatible, el número de fotogramas y el coste de los tokens visuales |\n| Contexto | Máximo de al menos 131,072 tokens | La precisión y el uso de memoria con la longitud máxima pueden diferir de los de entradas cortas |\n| Idiomas | Al menos 100 idiomas | No significa que la calidad sea igual en todos los idiomas |\n| Versiones de baja precisión | K-Quant-17GB, K-Quant-Dynamic | Debe distinguirse la capacidad incluida en el nombre de la memoria total necesaria para la ejecución |\n| Usos principales | Programación, automatización del escritorio, llamadas a funciones, análisis de documentos y evaluación | Las funciones reales dependen del entorno de ejecución conectado y de las políticas de permisos |\n| Método de aceleración | Speculative Decoding mediante el modelo drafter DFlash | El grado de aceleración varía según el hardware y la longitud de la entrada |\n| Formato de publicación | BF16, cuantización de 4 bits y modelo drafter | Es necesario comprobar en el repositorio los archivos disponibles y los entornos de ejecución compatibles |\n| Licencia | Presentada como Apache License 2.0 | Es necesario comprobar el archivo LICENSE real del repositorio del modelo y las condiciones adicionales de uso |\n\n## Cómo funciona un modelo de 30,000 millones de parámetros con 24GB\n\n### Cálculo simple de la memoria de los pesos\n\nSi solo se tienen en cuenta los pesos del modelo, el espacio de almacenamiento necesario puede calcularse aproximadamente de la siguiente manera.\n\n- BF16 o FP16: 30,000 millones × 2 bytes = aproximadamente 60GB\n- 8 bits: 30,000 millones × 1 byte = aproximadamente 30GB\n- 4 bits: 30,000 millones × 0.5 bytes = aproximadamente 15GB\n\nA los pesos de 4 bits se añaden las escalas de cuantización, los metadatos, la alineación y la sobrecarga del entorno de ejecución. Por tanto, el paquete de pesos de aproximadamente 17GB mencionado en los materiales proporcionados puede ser mayor que los 15GB teóricos.\n\n### Memoria necesaria además de los pesos\n\nQue exista un archivo de modelo de 17GB no significa que pueda ejecutarse directamente en un dispositivo con 17GB de memoria. En la inferencia real, los siguientes componentes también ocupan espacio.\n\n- Caché KV que conserva el historial de entrada y salida\n- Codificador visual que procesa las entradas de imagen\n- Activaciones intermedias y espacio de trabajo del entorno de ejecución\n- Modelos auxiliares como el drafter DFlash\n- Uso del sistema operativo, el escritorio y otras aplicaciones\n- Búferes y espacio de copia entre la GPU y la memoria del sistema\n\nLos materiales proporcionados describen K-Quant-17GB como una versión adaptada a entornos de aproximadamente 24GB y K-Quant-Dynamic como una versión adaptada a entornos de aproximadamente 32GB. Sin embargo, es necesario consultar las instrucciones reales de ejecución para determinar si la memoria mencionada se refiere a VRAM dedicada, a memoria unificada como la de Apple Silicon o a una configuración que también utiliza parte de la RAM del sistema.\n\nLa caché KV también aumenta a medida que se alarga el contexto. Por tanto, el mero hecho de que las especificaciones indiquen compatibilidad con 131,072 tokens no permite concluir que la longitud máxima pueda utilizarse siempre en un entorno de 24GB.\n\n## Motivos de su diseño como agente de IA local\n\nEl agente al que aspira Muse Glimmer es distinto de un chatbot que responde una vez a una pregunta y termina. Un flujo de trabajo habitual es el siguiente.\n\n1. Interpreta el objetivo del usuario y las restricciones.\n2. Planifica las subtareas necesarias para completarlo.\n3. Llama a herramientas de búsqueda de archivos, funciones, terminal o navegador.\n4. Lee los resultados de ejecución y los mensajes de error.\n5. Modifica el plan o el código.\n6. Vuelve a ejecutar herramientas de prueba o verificación.\n7. Repite el proceso hasta cumplir las condiciones de finalización.\n\nPor ejemplo, en una tarea destinada a corregir un error de un proyecto se suceden el análisis del código fuente, la ejecución de comandos, la lectura de registros, la modificación del código, las pruebas y nuevas correcciones. Como la inferencia del modelo se repite en cada etapa, son importantes no solo la velocidad de respuesta, sino también la precisión de las llamadas a herramientas, la capacidad de recuperarse de fallos y el mantenimiento del estado.\n\n## Método de entrenamiento y capacidades como agente\n\nSegún los materiales proporcionados, Muse Glimmer se preentrenó mediante un método de destilación que aprovechaba los resultados de un modelo docente más grande llamado Muse Spark. Posteriormente, se añadieron datos para contextos largos y tareas de agentes, y se indicó que en el posentrenamiento se utilizaron aprendizaje supervisado, destilación on-policy y aprendizaje por refuerzo.\n\nEl papel general de cada método puede entenderse de la siguiente manera.\n\n- **Destilación:** entrena al modelo pequeño para que imite las salidas o el comportamiento de un modelo docente más grande.\n- **Aprendizaje supervisado:** proporciona como ejemplos correctos respuestas, llamadas a funciones o procesos de trabajo deseables.\n- **Aprendizaje on-policy:** corrige errores a partir de las trayectorias de comportamiento generadas realmente por el modelo actual.\n- **Aprendizaje por refuerzo:** optimiza recompensas como completar correctamente las tareas, utilizar las herramientas con precisión y respetar las reglas de seguridad.\n\nEstos procedimientos de entrenamiento no garantizan automáticamente la tasa de éxito del agente. El alcance de los datos de entrenamiento, el entorno de evaluación, las definiciones de las herramientas y el sandbox de ejecución influyen considerablemente en los resultados.\n\n## Funciones multimodales y ámbitos de aplicación\n\nMuse Glimmer se presentó como un modelo multimodal capaz de comprender entradas de imagen además de texto. Los tipos de entrada y casos de uso previsibles son los siguientes.\n\n| Entrada visual | Ejemplos de tareas posibles |\n|---|---|\n| Captura de pantalla de un PC | Interpretar mensajes de error o el estado de la interfaz de usuario |\n| Imagen de un documento | Extraer y resumir el contenido de tablas, párrafos y formularios |\n| Gráficos y diagramas | Leer y explicar ejes, leyendas y tendencias |\n| Pantalla de una GUI | Identificar botones y campos de entrada para planificar la siguiente acción |\n| Pantalla de herramientas de desarrollo | Analizar la salida del terminal o el estado del depurador |\n| Varios archivos e imágenes | Comparar documentos y conservar el historial de tareas de larga duración |\n\nLa comprensión visual y el manejo real de un ordenador son funciones distintas. Aunque el modelo interprete la pantalla, necesita un entorno de ejecución de agentes, una interfaz de accesibilidad o herramientas de automatización independientes para controlar el ratón o el teclado.\n\n## DFlash y Speculative Decoding\n\nPor lo general, los modelos de lenguaje autorregresivos calculan secuencialmente el siguiente token a partir de los tokens generados con anterioridad. Speculative Decoding es un método en el que un modelo drafter más pequeño propone primero varios tokens candidatos y el modelo principal los verifica de una sola vez.\n\nEl proceso puede resumirse de la siguiente manera.\n\n1. El drafter DFlash propone un conjunto de tokens con una alta probabilidad de aparecer a continuación.\n2. El modelo principal Muse Glimmer verifica los tokens propuestos.\n3. Se aceptan los tokens que coinciden con la distribución del modelo principal.\n4. La generación se reanuda desde el punto en el que dejan de coincidir.\n\nSi se utiliza un procedimiento de verificación preciso, es posible reducir el tiempo de generación manteniendo la distribución de salida del modelo principal. Sin embargo, si la tasa de acierto del drafter es baja o el ancho de banda de la memoria es insuficiente, la aceleración puede ser menor de lo esperado.\n\n## Velocidad de generación indicada en los materiales proporcionados\n\nLas siguientes cifras se presentaron como resultados de mediciones internas de Meta al aplicar el drafter DFlash a K-Quant-17GB. No son benchmarks independientes, y existen limitaciones para realizar comparaciones directas si no se especifican la configuración del hardware, el prompt, la longitud del contexto, el entorno de ejecución y las condiciones energéticas.\n\n| Hardware | Velocidad básica | Con DFlash | Mejora indicada |\n|---|---:|---:|---:|\n| NVIDIA GeForce RTX 5090 | 74.9 tokens/segundo | 233.4 tokens/segundo | Aproximadamente 3.1 veces |\n| Apple M5 Max | 26.6 tokens/segundo | 50.2 tokens/segundo | Aproximadamente 1.8 veces |\n| Apple M4 Max | 23.7 tokens/segundo | 37.8 tokens/segundo | Aproximadamente 1.5 veces |\n\nComo los agentes realizan inferencias varias veces y esperan a herramientas externas, la velocidad de generación de tokens no coincide necesariamente con el tiempo total de la tarea. El tiempo real de finalización también incluye la velocidad de procesamiento del prompt, la entrada y salida de archivos, la ejecución de código, el acceso a la red y el número de reintentos de las herramientas.\n\n## Cómo interpretar los resultados de los benchmarks\n\nLos materiales proporcionados comparan Muse Glimmer con Gemma 4 31B y Qwen 3.6 27B, y presentan los siguientes resultados.\n\n| Benchmark | Muse Glimmer | Gemma 4 31B | Qwen 3.6 27B |\n|---|---:|---:|---:|\n| MCP Atlas | 75.5 | 54.2 | 62.5 |\n| DeepSearch QA | 74.6 | Los materiales no incluyen una cifra | Los materiales no incluyen una cifra |\n\nAl mismo tiempo, se indicó que Qwen 3.6 27B obtuvo resultados superiores a Muse Glimmer en OSWorld Verified, TerminalBench 2.1 y SWE-bench Verified. Esto significa que las evaluaciones específicas para cada objetivo son más importantes que una única puntuación media.\n\nAl revisar los benchmarks, deben comprobarse los siguientes aspectos.\n\n- Si se utilizaron las mismas condiciones de precisión y cuantización del modelo\n- Si el número de llamadas a herramientas y el límite de tiempo fueron iguales\n- Si se publicaron el prompt del agente y el código de orquestación\n- Si la resolución de imagen y el contexto máximo fueron iguales\n- Si se proporcionaron la media y la varianza de varias ejecuciones\n- Si se examinó la posibilidad de que los datos de evaluación estuvieran incluidos en los datos de entrenamiento\n- Si una persona corrigió o reinició las tareas fallidas\n\nSegún los materiales proporcionados, en el promedio de 15 benchmarks se midió una disminución del rendimiento de aproximadamente 0.2% en K-Quant-Dynamic respecto al original y de aproximadamente 1% en K-Quant-17GB. Estas cifras también se presentaron como valores de evaluaciones internas de Meta, y la reducción para cada tarea puede diferir del promedio.\n\n## Efectos y limitaciones de la ejecución local sobre la privacidad\n\nUna configuración completamente local ayuda a crear sistemas que no envíen a una API de LLM externa el código fuente, los documentos internos, las capturas de pantalla ni el contenido de bases de datos. También ofrece las ventajas de poder utilizarse en redes cerradas y evitar las tarifas por token de las API externas.\n\nSin embargo, el mero hecho de que el archivo del modelo esté almacenado localmente no significa que todos los flujos de datos permanezcan en el entorno local. Los siguientes componentes pueden conectarse al exterior.\n\n- Herramientas de búsqueda web o navegadores remotos\n- Telemetría de análisis de errores y uso\n- Extensiones y plugins de agentes\n- Repositorios de documentos basados en la nube\n- Gestores de paquetes y repositorios de código\n- Servicios remotos de embeddings, búsqueda o evaluación\n\nLas organizaciones que manejan información sensible deben comprobar los registros de red y los procesos en ejecución, y revisar las rutas de los datos no solo del entorno de ejecución del modelo, sino también de todas las herramientas conectadas.\n\n## Riesgos de seguridad de los agentes locales y medidas de respuesta\n\nLa IA local puede reducir los riesgos de transmisión, pero también puede aumentar los riesgos derivados de los permisos del sistema. En particular, debe prestarse atención a la inyección indirecta de prompts, en la que instrucciones ocultas en documentos externos o páginas web cambian el objetivo original del agente.\n\nSe recomiendan los siguientes métodos de defensa.\n\n- Ejecutarlo primero en un espacio de trabajo de solo lectura.\n- Permitir únicamente las carpetas necesarias, no todo el directorio personal.\n- Exigir la aprobación de una persona para eliminaciones, sobrescrituras, transferencias de dinero y despliegues.\n- Bloquear los privilegios de administrador y el acceso a las carpetas esenciales del sistema operativo.\n- No introducir directamente claves secretas ni tokens de autenticación en el contexto del modelo.\n- Establecer listas de comandos permitidos y límites de tiempo de ejecución para los comandos del terminal.\n- Tratar las frases de documentos externos como datos no fiables.\n- Crear una instantánea o un commit de control de versiones antes de realizar cambios.\n- Conservar en registros de auditoría todas las llamadas a herramientas y modificaciones de archivos.\n- Probarlo en un contenedor o una máquina virtual separados del entorno real de producción.\n\nEn los ámbitos médico, financiero, jurídico, militar y público, el procesamiento local por sí solo no garantiza el cumplimiento normativo. También son necesarios controles de acceso, conservación de registros, aprobación de responsables, clasificación de datos y validación del modelo.\n\n## Qué implica la publicación bajo Apache 2.0\n\nLos materiales proporcionados explican que los pesos de Muse Glimmer se publicaron bajo Apache License 2.0. Apache 2.0 es, en general, una licencia permisiva que autoriza el uso, la modificación, la distribución y el uso comercial, e incluye cláusulas explícitas sobre patentes. Al redistribuir, deben cumplirse condiciones como conservar una copia de la licencia, mantener los avisos de derechos de autor e indicar los cambios.\n\nSin embargo, al utilizar realmente el modelo, deben comprobarse por separado los siguientes aspectos.\n\n- Si cada archivo del modelo está realmente sujeto a Apache 2.0\n- Si la ficha del modelo o el repositorio incluyen restricciones adicionales de uso\n- Si el código y el tokenizador incluidos tienen la misma licencia\n- Si el codificador visual y el modelo drafter tienen condiciones independientes\n- Si los derechos de marca o los derechos sobre datos de terceros están incluidos en el alcance de la autorización\n\nLa publicación de los pesos no significa que todo el proceso de entrenamiento sea de código abierto. Según los materiales proporcionados, no se publicaron todos los datos de entrenamiento ni todo el código de entrenamiento. Por tanto, Muse Glimmer puede denominarse modelo de pesos abiertos, pero no debe afirmarse que sea un modelo completamente de código abierto cuyo proceso de entrenamiento pueda reproducirse en su totalidad.\n\n## Lista de comprobación antes de la adopción\n\nAl evaluar un producto, los resultados que reproducen las tareas propias son más importantes que la velocidad máxima indicada en los materiales de prensa.\n\n1. Comprobar la entidad oficial responsable de la distribución y el repositorio del modelo.\n2. Comprobar en la ficha del modelo la arquitectura, el contexto, los idiomas compatibles y los formatos de entrada.\n3. Hacer que el equipo jurídico revise el archivo LICENSE y las condiciones de uso adicionales.\n4. Medir la memoria máxima, incluidos el modelo, la caché KV, el codificador visual y el drafter.\n5. Evaluar con documentos y código reales la precisión, la tasa de éxito de las herramientas y la tasa de recuperación tras fallos.\n6. Medir la velocidad de procesamiento de entrada y el aumento del uso de memoria con contextos largos.\n7. Bloquear la red y comprobar que todas las funciones operan realmente de forma local.\n8. Realizar pruebas de ataques mediante inyección de prompts y archivos maliciosos.\n9. Aplicar la aprobación humana y copias de seguridad automáticas a los cambios importantes.\n10. Comparar para cada tarea las diferencias de calidad entre las versiones cuantizadas y el original BF16.\n\n## Evaluación general\n\nEl elemento diferenciador de Muse Glimmer no es tanto la afirmación de que sea un modelo generalista con la puntuación más alta en todos los benchmarks, sino su diseño orientado a adaptar un modelo multimodal de 30,000 millones de parámetros y funciones de agente de larga duración al hardware de consumo. Si la cuantización de 4 bits, el contexto largo, la aceleración DFlash y la licencia permisiva se ofrecen tal como se indica en los materiales oficiales, podría convertirse en una opción relevante para la programación local, el análisis de documentos y la automatización en redes cerradas.\n\nPor otra parte, las referencias a 24GB o 32GB no garantizan que todas las funciones del modelo y el contexto máximo funcionen con fluidez en cualquier dispositivo. Hasta que se confirmen la ficha oficial del modelo y benchmarks reproducibles, es necesario distinguir las cifras de velocidad y calidad como afirmaciones basadas en mediciones internas de Meta, y evaluar la memoria, la seguridad y la precisión con cargas de trabajo reales.","content_html":"\u003cp\u003eMeta Muse Glimmer se presentó como un modelo con aproximadamente 30,000 millones de parámetros diseñado para ejecutarse en un PC personal o un portátil de alto rendimiento y permitir implementar sobre él agentes de IA locales que funcionen durante largos periodos. Su objetivo principal no se limita a la generación de texto, sino que también busca comprender imágenes y pantallas, y utilizar herramientas como archivos, funciones y terminales a lo largo de múltiples pasos.\u003c/p\u003e\n\u003cp\u003eLas especificaciones del producto y las cifras de los benchmarks de este artículo se han recopilado a partir de los anuncios de Meta citados en los materiales proporcionados. Dado que no se facilitaron las URL directas del artículo original ni de la ficha oficial del modelo, las cifras no deben interpretarse como resultados verificados de forma independiente.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#especificaciones-principales-de-muse-glimmer\" class=\"anchor\" id=\"especificaciones-principales-de-muse-glimmer\"\u003e\u003c/a\u003eEspecificaciones principales de Muse Glimmer\u003c/h2\u003e\n\u003cp\u003eLas principales especificaciones descritas en los materiales proporcionados son las siguientes.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eElemento\u003c/th\u003e\n\u003cth\u003eInformación presentada\u003c/th\u003e\n\u003cth\u003eAspectos que deben tenerse en cuenta al interpretarla\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eTamaño del modelo\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eAproximadamente 30,000 millones de parámetros\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eEs necesario consultar la ficha del modelo para conocer los parámetros activos reales y la arquitectura detallada\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eFormatos de entrada\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eTexto e imágenes\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eEs necesario comprobar por separado la resolución de imagen compatible, el número de fotogramas y el coste de los tokens visuales\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eContexto\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eMáximo de al menos 131,072 tokens\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eLa precisión y el uso de memoria con la longitud máxima pueden diferir de los de entradas cortas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eIdiomas\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eAl menos 100 idiomas\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eNo significa que la calidad sea igual en todos los idiomas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eVersiones de baja precisión\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eK-Quant-17GB, K-Quant-Dynamic\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eDebe distinguirse la capacidad incluida en el nombre de la memoria total necesaria para la ejecución\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eUsos principales\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eProgramación, automatización del escritorio, llamadas a funciones, análisis de documentos y evaluación\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eLas funciones reales dependen del entorno de ejecución conectado y de las políticas de permisos\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eMétodo de aceleración\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eSpeculative Decoding mediante el modelo drafter DFlash\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eEl grado de aceleración varía según el hardware y la longitud de la entrada\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eFormato de publicación\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003eBF16, cuantización de 4 bits y modelo drafter\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eEs necesario comprobar en el repositorio los archivos disponibles y los entornos de ejecución compatibles\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eLicencia\u003c/td\u003e\n\u003ctd data-label=\"Información presentada\"\u003ePresentada como Apache License 2.0\u003c/td\u003e\n\u003ctd data-label=\"Aspectos que deben tenerse en cuenta al interpretarla\"\u003eEs necesario comprobar el archivo LICENSE real del repositorio del modelo y las condiciones adicionales de uso\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003ch2\u003e\n\u003ca href=\"#c%C3%B3mo-funciona-un-modelo-de-30000-millones-de-par%C3%A1metros-con-24gb\" class=\"anchor\" id=\"cómo-funciona-un-modelo-de-30000-millones-de-parámetros-con-24gb\"\u003e\u003c/a\u003eCómo funciona un modelo de 30,000 millones de parámetros con 24GB\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#c%C3%A1lculo-simple-de-la-memoria-de-los-pesos\" class=\"anchor\" id=\"cálculo-simple-de-la-memoria-de-los-pesos\"\u003e\u003c/a\u003eCálculo simple de la memoria de los pesos\u003c/h3\u003e\n\u003cp\u003eSi solo se tienen en cuenta los pesos del modelo, el espacio de almacenamiento necesario puede calcularse aproximadamente de la siguiente manera.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eBF16 o FP16: 30,000 millones × 2 bytes = aproximadamente 60GB\u003c/li\u003e\n\u003cli\u003e8 bits: 30,000 millones × 1 byte = aproximadamente 30GB\u003c/li\u003e\n\u003cli\u003e4 bits: 30,000 millones × 0.5 bytes = aproximadamente 15GB\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eA los pesos de 4 bits se añaden las escalas de cuantización, los metadatos, la alineación y la sobrecarga del entorno de ejecución. Por tanto, el paquete de pesos de aproximadamente 17GB mencionado en los materiales proporcionados puede ser mayor que los 15GB teóricos.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#memoria-necesaria-adem%C3%A1s-de-los-pesos\" class=\"anchor\" id=\"memoria-necesaria-además-de-los-pesos\"\u003e\u003c/a\u003eMemoria necesaria además de los pesos\u003c/h3\u003e\n\u003cp\u003eQue exista un archivo de modelo de 17GB no significa que pueda ejecutarse directamente en un dispositivo con 17GB de memoria. En la inferencia real, los siguientes componentes también ocupan espacio.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eCaché KV que conserva el historial de entrada y salida\u003c/li\u003e\n\u003cli\u003eCodificador visual que procesa las entradas de imagen\u003c/li\u003e\n\u003cli\u003eActivaciones intermedias y espacio de trabajo del entorno de ejecución\u003c/li\u003e\n\u003cli\u003eModelos auxiliares como el drafter DFlash\u003c/li\u003e\n\u003cli\u003eUso del sistema operativo, el escritorio y otras aplicaciones\u003c/li\u003e\n\u003cli\u003eBúferes y espacio de copia entre la GPU y la memoria del sistema\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eLos materiales proporcionados describen K-Quant-17GB como una versión adaptada a entornos de aproximadamente 24GB y K-Quant-Dynamic como una versión adaptada a entornos de aproximadamente 32GB. Sin embargo, es necesario consultar las instrucciones reales de ejecución para determinar si la memoria mencionada se refiere a VRAM dedicada, a memoria unificada como la de Apple Silicon o a una configuración que también utiliza parte de la RAM del sistema.\u003c/p\u003e\n\u003cp\u003eLa caché KV también aumenta a medida que se alarga el contexto. Por tanto, el mero hecho de que las especificaciones indiquen compatibilidad con 131,072 tokens no permite concluir que la longitud máxima pueda utilizarse siempre en un entorno de 24GB.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#motivos-de-su-dise%C3%B1o-como-agente-de-ia-local\" class=\"anchor\" id=\"motivos-de-su-diseño-como-agente-de-ia-local\"\u003e\u003c/a\u003eMotivos de su diseño como agente de IA local\u003c/h2\u003e\n\u003cp\u003eEl agente al que aspira Muse Glimmer es distinto de un chatbot que responde una vez a una pregunta y termina. Un flujo de trabajo habitual es el siguiente.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eInterpreta el objetivo del usuario y las restricciones.\u003c/li\u003e\n\u003cli\u003ePlanifica las subtareas necesarias para completarlo.\u003c/li\u003e\n\u003cli\u003eLlama a herramientas de búsqueda de archivos, funciones, terminal o navegador.\u003c/li\u003e\n\u003cli\u003eLee los resultados de ejecución y los mensajes de error.\u003c/li\u003e\n\u003cli\u003eModifica el plan o el código.\u003c/li\u003e\n\u003cli\u003eVuelve a ejecutar herramientas de prueba o verificación.\u003c/li\u003e\n\u003cli\u003eRepite el proceso hasta cumplir las condiciones de finalización.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003ePor ejemplo, en una tarea destinada a corregir un error de un proyecto se suceden el análisis del código fuente, la ejecución de comandos, la lectura de registros, la modificación del código, las pruebas y nuevas correcciones. Como la inferencia del modelo se repite en cada etapa, son importantes no solo la velocidad de respuesta, sino también la precisión de las llamadas a herramientas, la capacidad de recuperarse de fallos y el mantenimiento del estado.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#m%C3%A9todo-de-entrenamiento-y-capacidades-como-agente\" class=\"anchor\" id=\"método-de-entrenamiento-y-capacidades-como-agente\"\u003e\u003c/a\u003eMétodo de entrenamiento y capacidades como agente\u003c/h2\u003e\n\u003cp\u003eSegún los materiales proporcionados, Muse Glimmer se preentrenó mediante un método de destilación que aprovechaba los resultados de un modelo docente más grande llamado Muse Spark. Posteriormente, se añadieron datos para contextos largos y tareas de agentes, y se indicó que en el posentrenamiento se utilizaron aprendizaje supervisado, destilación on-policy y aprendizaje por refuerzo.\u003c/p\u003e\n\u003cp\u003eEl papel general de cada método puede entenderse de la siguiente manera.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eDestilación:\u003c/strong\u003e entrena al modelo pequeño para que imite las salidas o el comportamiento de un modelo docente más grande.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAprendizaje supervisado:\u003c/strong\u003e proporciona como ejemplos correctos respuestas, llamadas a funciones o procesos de trabajo deseables.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAprendizaje on-policy:\u003c/strong\u003e corrige errores a partir de las trayectorias de comportamiento generadas realmente por el modelo actual.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eAprendizaje por refuerzo:\u003c/strong\u003e optimiza recompensas como completar correctamente las tareas, utilizar las herramientas con precisión y respetar las reglas de seguridad.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEstos procedimientos de entrenamiento no garantizan automáticamente la tasa de éxito del agente. El alcance de los datos de entrenamiento, el entorno de evaluación, las definiciones de las herramientas y el sandbox de ejecución influyen considerablemente en los resultados.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#funciones-multimodales-y-%C3%A1mbitos-de-aplicaci%C3%B3n\" class=\"anchor\" id=\"funciones-multimodales-y-ámbitos-de-aplicación\"\u003e\u003c/a\u003eFunciones multimodales y ámbitos de aplicación\u003c/h2\u003e\n\u003cp\u003eMuse Glimmer se presentó como un modelo multimodal capaz de comprender entradas de imagen además de texto. Los tipos de entrada y casos de uso previsibles son los siguientes.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eEntrada visual\u003c/th\u003e\n\u003cth\u003eEjemplos de tareas posibles\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eCaptura de pantalla de un PC\u003c/td\u003e\n\u003ctd data-label=\"Ejemplos de tareas posibles\"\u003eInterpretar mensajes de error o el estado de la interfaz de usuario\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eImagen de un documento\u003c/td\u003e\n\u003ctd data-label=\"Ejemplos de tareas posibles\"\u003eExtraer y resumir el contenido de tablas, párrafos y formularios\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eGráficos y diagramas\u003c/td\u003e\n\u003ctd data-label=\"Ejemplos de tareas posibles\"\u003eLeer y explicar ejes, leyendas y tendencias\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003ePantalla de una GUI\u003c/td\u003e\n\u003ctd data-label=\"Ejemplos de tareas posibles\"\u003eIdentificar botones y campos de entrada para planificar la siguiente acción\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003ePantalla de herramientas de desarrollo\u003c/td\u003e\n\u003ctd data-label=\"Ejemplos de tareas posibles\"\u003eAnalizar la salida del terminal o el estado del depurador\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Entrada visual\"\u003eVarios archivos e imágenes\u003c/td\u003e\n\u003ctd data-label=\"Ejemplos de tareas posibles\"\u003eComparar documentos y conservar el historial de tareas de larga duración\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eLa comprensión visual y el manejo real de un ordenador son funciones distintas. Aunque el modelo interprete la pantalla, necesita un entorno de ejecución de agentes, una interfaz de accesibilidad o herramientas de automatización independientes para controlar el ratón o el teclado.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#dflash-y-speculative-decoding\" class=\"anchor\" id=\"dflash-y-speculative-decoding\"\u003e\u003c/a\u003eDFlash y Speculative Decoding\u003c/h2\u003e\n\u003cp\u003ePor lo general, los modelos de lenguaje autorregresivos calculan secuencialmente el siguiente token a partir de los tokens generados con anterioridad. Speculative Decoding es un método en el que un modelo drafter más pequeño propone primero varios tokens candidatos y el modelo principal los verifica de una sola vez.\u003c/p\u003e\n\u003cp\u003eEl proceso puede resumirse de la siguiente manera.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eEl drafter DFlash propone un conjunto de tokens con una alta probabilidad de aparecer a continuación.\u003c/li\u003e\n\u003cli\u003eEl modelo principal Muse Glimmer verifica los tokens propuestos.\u003c/li\u003e\n\u003cli\u003eSe aceptan los tokens que coinciden con la distribución del modelo principal.\u003c/li\u003e\n\u003cli\u003eLa generación se reanuda desde el punto en el que dejan de coincidir.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eSi se utiliza un procedimiento de verificación preciso, es posible reducir el tiempo de generación manteniendo la distribución de salida del modelo principal. Sin embargo, si la tasa de acierto del drafter es baja o el ancho de banda de la memoria es insuficiente, la aceleración puede ser menor de lo esperado.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#velocidad-de-generaci%C3%B3n-indicada-en-los-materiales-proporcionados\" class=\"anchor\" id=\"velocidad-de-generación-indicada-en-los-materiales-proporcionados\"\u003e\u003c/a\u003eVelocidad de generación indicada en los materiales proporcionados\u003c/h2\u003e\n\u003cp\u003eLas siguientes cifras se presentaron como resultados de mediciones internas de Meta al aplicar el drafter DFlash a K-Quant-17GB. No son benchmarks independientes, y existen limitaciones para realizar comparaciones directas si no se especifican la configuración del hardware, el prompt, la longitud del contexto, el entorno de ejecución y las condiciones energéticas.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eHardware\u003c/th\u003e\n\u003cth\u003eVelocidad básica\u003c/th\u003e\n\u003cth\u003eCon DFlash\u003c/th\u003e\n\u003cth\u003eMejora indicada\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eNVIDIA GeForce RTX 5090\u003c/td\u003e\n\u003ctd data-label=\"Velocidad básica\"\u003e74.9 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Con DFlash\"\u003e233.4 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Mejora indicada\"\u003eAproximadamente 3.1 veces\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eApple M5 Max\u003c/td\u003e\n\u003ctd data-label=\"Velocidad básica\"\u003e26.6 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Con DFlash\"\u003e50.2 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Mejora indicada\"\u003eAproximadamente 1.8 veces\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eApple M4 Max\u003c/td\u003e\n\u003ctd data-label=\"Velocidad básica\"\u003e23.7 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Con DFlash\"\u003e37.8 tokens/segundo\u003c/td\u003e\n\u003ctd data-label=\"Mejora indicada\"\u003eAproximadamente 1.5 veces\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eComo los agentes realizan inferencias varias veces y esperan a herramientas externas, la velocidad de generación de tokens no coincide necesariamente con el tiempo total de la tarea. El tiempo real de finalización también incluye la velocidad de procesamiento del prompt, la entrada y salida de archivos, la ejecución de código, el acceso a la red y el número de reintentos de las herramientas.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#c%C3%B3mo-interpretar-los-resultados-de-los-benchmarks\" class=\"anchor\" id=\"cómo-interpretar-los-resultados-de-los-benchmarks\"\u003e\u003c/a\u003eCómo interpretar los resultados de los benchmarks\u003c/h2\u003e\n\u003cp\u003eLos materiales proporcionados comparan Muse Glimmer con Gemma 4 31B y Qwen 3.6 27B, y presentan los siguientes resultados.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eBenchmark\u003c/th\u003e\n\u003cth\u003eMuse Glimmer\u003c/th\u003e\n\u003cth\u003eGemma 4 31B\u003c/th\u003e\n\u003cth\u003eQwen 3.6 27B\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Benchmark\"\u003eMCP Atlas\u003c/td\u003e\n\u003ctd data-label=\"Muse Glimmer\"\u003e75.5\u003c/td\u003e\n\u003ctd data-label=\"Gemma 4 31B\"\u003e54.2\u003c/td\u003e\n\u003ctd data-label=\"Qwen 3.6 27B\"\u003e62.5\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Benchmark\"\u003eDeepSearch QA\u003c/td\u003e\n\u003ctd data-label=\"Muse Glimmer\"\u003e74.6\u003c/td\u003e\n\u003ctd data-label=\"Gemma 4 31B\"\u003eLos materiales no incluyen una cifra\u003c/td\u003e\n\u003ctd data-label=\"Qwen 3.6 27B\"\u003eLos materiales no incluyen una cifra\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eAl mismo tiempo, se indicó que Qwen 3.6 27B obtuvo resultados superiores a Muse Glimmer en OSWorld Verified, TerminalBench 2.1 y SWE-bench Verified. Esto significa que las evaluaciones específicas para cada objetivo son más importantes que una única puntuación media.\u003c/p\u003e\n\u003cp\u003eAl revisar los benchmarks, deben comprobarse los siguientes aspectos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eSi se utilizaron las mismas condiciones de precisión y cuantización del modelo\u003c/li\u003e\n\u003cli\u003eSi el número de llamadas a herramientas y el límite de tiempo fueron iguales\u003c/li\u003e\n\u003cli\u003eSi se publicaron el prompt del agente y el código de orquestación\u003c/li\u003e\n\u003cli\u003eSi la resolución de imagen y el contexto máximo fueron iguales\u003c/li\u003e\n\u003cli\u003eSi se proporcionaron la media y la varianza de varias ejecuciones\u003c/li\u003e\n\u003cli\u003eSi se examinó la posibilidad de que los datos de evaluación estuvieran incluidos en los datos de entrenamiento\u003c/li\u003e\n\u003cli\u003eSi una persona corrigió o reinició las tareas fallidas\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eSegún los materiales proporcionados, en el promedio de 15 benchmarks se midió una disminución del rendimiento de aproximadamente 0.2% en K-Quant-Dynamic respecto al original y de aproximadamente 1% en K-Quant-17GB. Estas cifras también se presentaron como valores de evaluaciones internas de Meta, y la reducción para cada tarea puede diferir del promedio.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#efectos-y-limitaciones-de-la-ejecuci%C3%B3n-local-sobre-la-privacidad\" class=\"anchor\" id=\"efectos-y-limitaciones-de-la-ejecución-local-sobre-la-privacidad\"\u003e\u003c/a\u003eEfectos y limitaciones de la ejecución local sobre la privacidad\u003c/h2\u003e\n\u003cp\u003eUna configuración completamente local ayuda a crear sistemas que no envíen a una API de LLM externa el código fuente, los documentos internos, las capturas de pantalla ni el contenido de bases de datos. También ofrece las ventajas de poder utilizarse en redes cerradas y evitar las tarifas por token de las API externas.\u003c/p\u003e\n\u003cp\u003eSin embargo, el mero hecho de que el archivo del modelo esté almacenado localmente no significa que todos los flujos de datos permanezcan en el entorno local. Los siguientes componentes pueden conectarse al exterior.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eHerramientas de búsqueda web o navegadores remotos\u003c/li\u003e\n\u003cli\u003eTelemetría de análisis de errores y uso\u003c/li\u003e\n\u003cli\u003eExtensiones y plugins de agentes\u003c/li\u003e\n\u003cli\u003eRepositorios de documentos basados en la nube\u003c/li\u003e\n\u003cli\u003eGestores de paquetes y repositorios de código\u003c/li\u003e\n\u003cli\u003eServicios remotos de embeddings, búsqueda o evaluación\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eLas organizaciones que manejan información sensible deben comprobar los registros de red y los procesos en ejecución, y revisar las rutas de los datos no solo del entorno de ejecución del modelo, sino también de todas las herramientas conectadas.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#riesgos-de-seguridad-de-los-agentes-locales-y-medidas-de-respuesta\" class=\"anchor\" id=\"riesgos-de-seguridad-de-los-agentes-locales-y-medidas-de-respuesta\"\u003e\u003c/a\u003eRiesgos de seguridad de los agentes locales y medidas de respuesta\u003c/h2\u003e\n\u003cp\u003eLa IA local puede reducir los riesgos de transmisión, pero también puede aumentar los riesgos derivados de los permisos del sistema. En particular, debe prestarse atención a la inyección indirecta de prompts, en la que instrucciones ocultas en documentos externos o páginas web cambian el objetivo original del agente.\u003c/p\u003e\n\u003cp\u003eSe recomiendan los siguientes métodos de defensa.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eEjecutarlo primero en un espacio de trabajo de solo lectura.\u003c/li\u003e\n\u003cli\u003ePermitir únicamente las carpetas necesarias, no todo el directorio personal.\u003c/li\u003e\n\u003cli\u003eExigir la aprobación de una persona para eliminaciones, sobrescrituras, transferencias de dinero y despliegues.\u003c/li\u003e\n\u003cli\u003eBloquear los privilegios de administrador y el acceso a las carpetas esenciales del sistema operativo.\u003c/li\u003e\n\u003cli\u003eNo introducir directamente claves secretas ni tokens de autenticación en el contexto del modelo.\u003c/li\u003e\n\u003cli\u003eEstablecer listas de comandos permitidos y límites de tiempo de ejecución para los comandos del terminal.\u003c/li\u003e\n\u003cli\u003eTratar las frases de documentos externos como datos no fiables.\u003c/li\u003e\n\u003cli\u003eCrear una instantánea o un commit de control de versiones antes de realizar cambios.\u003c/li\u003e\n\u003cli\u003eConservar en registros de auditoría todas las llamadas a herramientas y modificaciones de archivos.\u003c/li\u003e\n\u003cli\u003eProbarlo en un contenedor o una máquina virtual separados del entorno real de producción.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEn los ámbitos médico, financiero, jurídico, militar y público, el procesamiento local por sí solo no garantiza el cumplimiento normativo. También son necesarios controles de acceso, conservación de registros, aprobación de responsables, clasificación de datos y validación del modelo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#qu%C3%A9-implica-la-publicaci%C3%B3n-bajo-apache-20\" class=\"anchor\" id=\"qué-implica-la-publicación-bajo-apache-20\"\u003e\u003c/a\u003eQué implica la publicación bajo Apache 2.0\u003c/h2\u003e\n\u003cp\u003eLos materiales proporcionados explican que los pesos de Muse Glimmer se publicaron bajo Apache License 2.0. Apache 2.0 es, en general, una licencia permisiva que autoriza el uso, la modificación, la distribución y el uso comercial, e incluye cláusulas explícitas sobre patentes. Al redistribuir, deben cumplirse condiciones como conservar una copia de la licencia, mantener los avisos de derechos de autor e indicar los cambios.\u003c/p\u003e\n\u003cp\u003eSin embargo, al utilizar realmente el modelo, deben comprobarse por separado los siguientes aspectos.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eSi cada archivo del modelo está realmente sujeto a Apache 2.0\u003c/li\u003e\n\u003cli\u003eSi la ficha del modelo o el repositorio incluyen restricciones adicionales de uso\u003c/li\u003e\n\u003cli\u003eSi el código y el tokenizador incluidos tienen la misma licencia\u003c/li\u003e\n\u003cli\u003eSi el codificador visual y el modelo drafter tienen condiciones independientes\u003c/li\u003e\n\u003cli\u003eSi los derechos de marca o los derechos sobre datos de terceros están incluidos en el alcance de la autorización\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eLa publicación de los pesos no significa que todo el proceso de entrenamiento sea de código abierto. Según los materiales proporcionados, no se publicaron todos los datos de entrenamiento ni todo el código de entrenamiento. Por tanto, Muse Glimmer puede denominarse modelo de pesos abiertos, pero no debe afirmarse que sea un modelo completamente de código abierto cuyo proceso de entrenamiento pueda reproducirse en su totalidad.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#lista-de-comprobaci%C3%B3n-antes-de-la-adopci%C3%B3n\" class=\"anchor\" id=\"lista-de-comprobación-antes-de-la-adopción\"\u003e\u003c/a\u003eLista de comprobación antes de la adopción\u003c/h2\u003e\n\u003cp\u003eAl evaluar un producto, los resultados que reproducen las tareas propias son más importantes que la velocidad máxima indicada en los materiales de prensa.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eComprobar la entidad oficial responsable de la distribución y el repositorio del modelo.\u003c/li\u003e\n\u003cli\u003eComprobar en la ficha del modelo la arquitectura, el contexto, los idiomas compatibles y los formatos de entrada.\u003c/li\u003e\n\u003cli\u003eHacer que el equipo jurídico revise el archivo LICENSE y las condiciones de uso adicionales.\u003c/li\u003e\n\u003cli\u003eMedir la memoria máxima, incluidos el modelo, la caché KV, el codificador visual y el drafter.\u003c/li\u003e\n\u003cli\u003eEvaluar con documentos y código reales la precisión, la tasa de éxito de las herramientas y la tasa de recuperación tras fallos.\u003c/li\u003e\n\u003cli\u003eMedir la velocidad de procesamiento de entrada y el aumento del uso de memoria con contextos largos.\u003c/li\u003e\n\u003cli\u003eBloquear la red y comprobar que todas las funciones operan realmente de forma local.\u003c/li\u003e\n\u003cli\u003eRealizar pruebas de ataques mediante inyección de prompts y archivos maliciosos.\u003c/li\u003e\n\u003cli\u003eAplicar la aprobación humana y copias de seguridad automáticas a los cambios importantes.\u003c/li\u003e\n\u003cli\u003eComparar para cada tarea las diferencias de calidad entre las versiones cuantizadas y el original BF16.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#evaluaci%C3%B3n-general\" class=\"anchor\" id=\"evaluación-general\"\u003e\u003c/a\u003eEvaluación general\u003c/h2\u003e\n\u003cp\u003eEl elemento diferenciador de Muse Glimmer no es tanto la afirmación de que sea un modelo generalista con la puntuación más alta en todos los benchmarks, sino su diseño orientado a adaptar un modelo multimodal de 30,000 millones de parámetros y funciones de agente de larga duración al hardware de consumo. Si la cuantización de 4 bits, el contexto largo, la aceleración DFlash y la licencia permisiva se ofrecen tal como se indica en los materiales oficiales, podría convertirse en una opción relevante para la programación local, el análisis de documentos y la automatización en redes cerradas.\u003c/p\u003e\n\u003cp\u003ePor otra parte, las referencias a 24GB o 32GB no garantizan que todas las funciones del modelo y el contexto máximo funcionen con fluidez en cualquier dispositivo. Hasta que se confirmen la ficha oficial del modelo y benchmarks reproducibles, es necesario distinguir las cifras de velocidad y calidad como afirmaciones basadas en mediciones internas de Meta, y evaluar la memoria, la seguridad y la precisión con cargas de trabajo reales.\u003c/p\u003e\n","tags":["Agentes de IA","Meta","Muse Glimmer","IA local","Cuantización"],"faqs":[{"question":"¿En qué se diferencia Muse Glimmer de los LLM locales convencionales?","answer":"Se diferencia en que su objetivo principal son los agentes de IA de ejecución prolongada que, en lugar de limitarse a ser chatbots que solo generan respuestas de texto, analizan archivos y pantallas, invocan herramientas como funciones o terminales y revisan los resultados para modificar sus planes."},{"question":"¿Un modelo de 30.000 millones de parámetros realmente funciona con 24 GB de memoria?","answer":"El material proporcionado explica que la versión K-Quant de 4 bits y 17 GB se adaptó para un entorno de aproximadamente 24 GB. Sin embargo, la memoria necesaria varía según la longitud del contexto, la entrada visual, la caché KV, el modelo drafter y el uso de memoria del sistema operativo, por lo que los 24 GB no deben interpretarse como una especificación mínima garantizada para todas las condiciones de uso."},{"question":"¿Por qué son diferentes los 17 GB del modelo y los 24 GB de memoria de ejecución?","answer":"17 GB es una expresión que se refiere principalmente al paquete de pesos cuantizados. Para la ejecución real se necesita además memoria para la caché KV, las activaciones intermedias, el codificador visual, el espacio de trabajo del entorno de ejecución y el sistema operativo."},{"question":"¿Se puede utilizar siempre un contexto de 131,072 tokens?","answer":"Aunque el modelo admita esa longitud, el máximo real puede verse limitado por el entorno de ejecución, la memoria, la precisión de la caché KV y la cantidad de entradas de imagen. También se debe evaluar por separado si la precisión de la recuperación de información se mantiene con la longitud máxima."},{"question":"¿DFlash drafter reduce la calidad de las respuestas del modelo?","answer":"Speculative Decoding está diseñado para que el modelo principal verifique los tokens propuestos por el drafter, por lo que, si se implementa correctamente, puede mantener la distribución de salida del modelo principal. No obstante, si cambian el método de implementación y la configuración de muestreo, también pueden variar los resultados y el grado de aceleración."},{"question":"Si se ejecuta localmente, ¿los datos nunca salen al exterior?","answer":"No es así. Aunque el modelo sea local, la búsqueda web, los complementos, los repositorios remotos, la telemetría o las herramientas de embeddings en la nube pueden transmitir datos. Es necesario comprobar las comunicaciones de red de toda la configuración del agente."},{"question":"¿Qué permisos es seguro conceder a un agente de IA local?","answer":"Es recomendable conceder los permisos mínimos únicamente a las carpetas de trabajo necesarias y ejecutarlo inicialmente en modo de solo lectura. Para tareas de alto riesgo, como eliminar archivos, realizar transmisiones externas, instalar software o hacer despliegues, se debe exigir la aprobación de una persona."},{"question":"Si es Apache 2.0, ¿se puede utilizar libremente con fines comerciales?","answer":"Apache 2.0 en sí es una licencia permisiva que permite el uso comercial, la modificación y la redistribución. Sin embargo, se deben consultar el archivo LICENSE y la tarjeta del modelo del repositorio oficial para comprobar si dicha licencia se aplica a los archivos reales del modelo y si existen condiciones adicionales y componentes de terceros."},{"question":"¿Muse Glimmer es un modelo completamente de código abierto?","answer":"Según el material proporcionado, los pesos se han publicado, pero no se han publicado todos los datos de entrenamiento ni todo el código de entrenamiento. Por tanto, se puede describir como un modelo de pesos abiertos, pero debe distinguirse si se trata de un modelo completamente de código abierto que permita reproducir todo el proceso de entrenamiento."},{"question":"¿Se pueden creer sin más la velocidad y los benchmarks presentados por Meta?","answer":"Las mediciones propias son útiles como referencia inicial, pero no sustituyen una verificación independiente. Se necesitan resultados de reproducción obtenidos con la misma cuantización, el mismo entorno de ejecución, la misma longitud de contexto, la misma configuración de energía y las mismas herramientas de agente."}],"sources":[{"url":"https://www.apache.org/licenses/LICENSE-2.0","title":"Licencia Apache, versión 2.0","type":"source"},{"url":"https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf","title":"NIST AI 600-1: Marco de gestión de riesgos de la inteligencia artificial—Perfil de inteligencia artificial generativa","type":"source"}],"images":[{"id":602,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NzE2MywicHVyIjoiYmxvYl9pZCJ9fQ==--655d2556aee6b63b88d70cffbc019429039bcd2b/ai-7afa8941.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"데이터 블록을 받아 문서·이미지·코드로 처리하는 로컬 AI 노트북 개념도","caption":"노트북에서 로컬 AI가 다양한 데이터를 처리하고 보안 워크플로를 수행하는 모습을 나타낸다.","description":null},"en":{"alt":"Local AI laptop processing data blocks into documents, images, folders, code, and charts","caption":"The diagram depicts a laptop running local AI for multimodal processing and secure workflows.","description":null},"ja":{"alt":"データブロックを文書・画像・コードなどに処理するローカルAI搭載ノートPCの概念図","caption":"ノートPC上のローカルAIが多様なデータを処理し、安全なワークフローを実行する様子を示す。","description":null},"es":{"alt":"Portátil con IA local que procesa bloques de datos en documentos, imágenes, código y gráficos","caption":"El diagrama muestra una IA local en un portátil gestionando datos multimodales y flujos seguros.","description":null},"id":{"alt":"Laptop AI lokal memproses blok data menjadi dokumen, gambar, folder, kode, dan grafik","caption":"Diagram ini menggambarkan AI lokal di laptop yang menangani data multimodal dan alur kerja aman.","description":null},"pt":{"alt":"Notebook com IA local processando blocos de dados em documentos, imagens, códigos e gráficos","caption":"O diagrama mostra uma IA local no notebook gerenciando dados multimodais e fluxos seguros.","description":null},"zh-hant":{"alt":"本機 AI 筆電將資料區塊處理成文件、圖像、資料夾、程式碼與圖表","caption":"示意圖呈現筆電上的本機 AI 處理多模態資料並執行安全工作流程。","description":null},"de":{"alt":"Laptop mit lokaler KI verarbeitet Datenblöcke zu Dokumenten, Bildern, Code und Diagrammen","caption":"Die Grafik zeigt lokale KI auf einem Laptop bei der multimodalen Verarbeitung und sicheren Abläufen.","description":null}}},{"id":603,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NzE2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--febd3177afd7cf52d6fa7bb0e86da563e46d0ffb/ai-34107f0a.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 칩이 표시된 노트북과 보안 방패, 파일, 경고, 성능 계기판을 배치한 일러스트","caption":"노트북에서 실행되는 로컬 AI의 보안, 파일 처리, 최적화 및 성능 측정을 시각화했다.","description":null},"en":{"alt":"Laptop with an AI chip, security shield, files, warnings, and performance gauges","caption":"The illustration visualizes security, file processing, optimization, and performance for local AI on a laptop.","description":null},"ja":{"alt":"AIチップを表示したノートPCと、セキュリティ盾、ファイル、警告、性能メーターの図","caption":"ノートPCで動作するローカルAIの安全性、ファイル処理、最適化、性能測定を表している。","description":null},"es":{"alt":"Portátil con chip de IA, escudo de seguridad, archivos, alertas y medidores de rendimiento","caption":"La ilustración representa la seguridad, el procesamiento, la optimización y el rendimiento de una IA local.","description":null},"id":{"alt":"Laptop dengan cip AI, perisai keamanan, berkas, peringatan, dan pengukur kinerja","caption":"Ilustrasi ini menggambarkan keamanan, pemrosesan berkas, optimasi, dan kinerja AI lokal di laptop.","description":null},"pt":{"alt":"Notebook com chip de IA, escudo de segurança, arquivos, alertas e medidores de desempenho","caption":"A ilustração mostra segurança, processamento de arquivos, otimização e desempenho de IA local no notebook.","description":null},"zh-hant":{"alt":"顯示 AI 晶片的筆電，周圍有安全盾牌、檔案、警告與效能儀表","caption":"插圖呈現筆電本機 AI 的安全性、檔案處理、最佳化與效能測量。","description":null},"de":{"alt":"Laptop mit KI-Chip, Sicherheitsschild, Dateien, Warnsymbolen und Leistungsanzeigen","caption":"Die Illustration zeigt Sicherheit, Dateiverarbeitung, Optimierung und Leistung lokaler KI auf einem Laptop.","description":null}}}],"published_at":"2026-08-12T14:00:06+09:00","updated_at":"2026-08-12T14:00:06+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/es/articles/meta-muse-glimmer-local-ai-agent-model"}