instalar ia local

Cuando hablamos de inteligencia artificial generativa solemos pensar en servicios como ChatGPT, Gemini o Claude. Estas plataformas ejecutan sus modelos en grandes centros de datos y requieren conexión a Internet. Sin embargo, también es posible instalar un modelo de lenguaje en nuestro propio ordenador y utilizarlo mediante una interfaz de conversación similar a ChatGPT.

Para hacerlo no es imprescindible disponer de una tarjeta gráfica dedicada. Una GPU moderna acelera considerablemente la generación de texto, pero un ordenador equipado con un procesador relativamente potente y suficiente memoria RAM también puede ejecutar modelos de inteligencia artificial localmente.

En este artículo veremos cómo instalar y configurar LM Studio en Windows 11, utilizando como ejemplo un equipo basado en un procesador Intel Xeon E5-2680 v4, 64 GB de memoria DDR4 ECC y una unidad NVMe. El procedimiento también es aplicable a otros ordenadores con características parecidas.

¿Qué significa ejecutar un modelo de IA localmente?

Un modelo de lenguaje local se descarga y ejecuta directamente en nuestro ordenador. Las preguntas, documentos y respuestas se procesan utilizando la CPU, la memoria RAM y, si está disponible, la tarjeta gráfica del propio equipo.

Después de descargar el programa y el modelo, no es necesario mantener una conexión permanente a Internet. LM Studio indica que las conversaciones, el procesamiento de documentos y la ejecución de su servidor local pueden funcionar completamente sin conexión. Según su documentación, lo introducido en los chats con modelos locales no abandona el dispositivo.

Esto proporciona varias ventajas:

  • Mayor privacidad.
  • Funcionamiento sin conexión a Internet.
  • Ausencia de cuotas por número de consultas.
  • Posibilidad de experimentar con numerosos modelos.
  • Control sobre el modelo, su configuración y sus archivos.
  • Integración con aplicaciones y programas propios.
  • Aprovechamiento de ordenadores que todavía disponen de una buena CPU y abundante memoria RAM.

Sin embargo, también existen limitaciones:

  • Los modelos locales suelen tener menos capacidad que los servicios comerciales más avanzados.
  • La generación de texto puede ser lenta si no se dispone de GPU.
  • Los modelos ocupan varios gigabytes.
  • No tienen acceso automático a Internet.
  • Pueden proporcionar respuestas incorrectas o inventadas.
  • La privacidad técnica no sustituye las condiciones legales o editoriales aplicables a documentos confidenciales.

Por tanto, un modelo local debe entenderse como una herramienta auxiliar. Sus respuestas siempre tienen que ser verificadas por una persona, especialmente en tareas científicas, técnicas, médicas o jurídicas.

El ordenador utilizado en esta prueba

El equipo empleado como referencia tiene las siguientes características:

  • Placa base HUANANZHI X99 QD4.
  • Procesador Intel Xeon E5-2680 v4.
  • 64 GB de memoria DDR4 ECC registrada a 2133 MHz.
  • Cuatro módulos de 16 GB.
  • Unidad de almacenamiento NVMe.
  • Windows 11.
  • Sin tarjeta gráfica dedicada para inteligencia artificial.

El Xeon E5-2680 v4 es un procesador Broadwell de 2016 que dispone de 14 núcleos, 28 hilos, 35 MB de memoria caché y una frecuencia turbo máxima de 3,3 GHz. También admite instrucciones AVX2 y cuatro canales de memoria.

Las instrucciones AVX2 son importantes porque LM Studio las necesita para funcionar en ordenadores Windows con procesadores x64. La documentación oficial recomienda al menos 16 GB de RAM y una GPU con 4 GB de memoria, aunque esta última es una recomendación y no un requisito absoluto.

La información completa del procesador puede consultarse en la página oficial de Intel.

La importancia de la memoria RAM

Cuando no existe una tarjeta gráfica dedicada, el modelo se carga principalmente en la memoria RAM y se ejecuta mediante la CPU. Por este motivo, disponer de 32 o 64 GB de memoria puede ser más importante que tener un número muy elevado de núcleos.

En este equipo se utilizan cuatro módulos de memoria. Si la placa los configura correctamente, el procesador puede acceder a ellos mediante cuatro canales. Esto aumenta el ancho de banda disponible, un aspecto especialmente importante durante la generación de texto.

Se puede comprobar la configuración con una herramienta como CPU-Z. En la pestaña Memory, el apartado correspondiente a los canales debería indicar Quad. Si aparece Dual, conviene revisar la colocación de los módulos y el manual de la placa base.

El NVMe reduce el tiempo necesario para cargar los archivos, pero una vez que el modelo se encuentra en la RAM, la velocidad depende fundamentalmente del procesador y del ancho de banda de la memoria.

¿Qué es LM Studio?

LM Studio es una aplicación de escritorio que permite buscar, descargar, administrar y ejecutar modelos de lenguaje en Windows, Linux y macOS. Su interfaz de conversación es parecida a la de ChatGPT: el usuario escribe una pregunta y el modelo genera una respuesta manteniendo el contexto del diálogo.

Entre sus principales funciones se encuentran:

  • Descargar modelos compatibles desde Hugging Face.
  • Ejecutar modelos localmente utilizando llama.cpp.
  • Mantener diferentes conversaciones.
  • Organizar los chats mediante carpetas.
  • Comparar conversaciones o modelos utilizando una vista dividida.
  • Adjuntar documentos PDF, DOCX y TXT.
  • Configurar el contexto, la temperatura y otros parámetros.
  • Crear un servidor local compatible con la API de OpenAI.
  • Utilizar los modelos descargados sin conexión a Internet.

Las conversaciones se guardan localmente. En Windows suelen encontrarse en:

%USERPROFILE%\.lmstudio\conversations

LM Studio explica que el modelo no aprende permanentemente de nuestros chats. Solamente puede utilizar la información que se encuentre disponible en el contexto de la conversación o en las instrucciones proporcionadas durante la sesión.

La aplicación puede descargarse desde su página oficial, mientras que su funcionamiento y configuración se explican en la documentación de LM Studio.

La presencia de una sección de precios en la página de LM Studio puede producir cierta confusión. Sin embargo, la instalación de la aplicación y la ejecución de modelos en nuestro propio ordenador están incluidas en su modalidad gratuita. El plan Free, cuyo precio es de cero dólares, permite:

¿LM Studio es gratuito?

  • Ejecutar modelos locales en el ordenador.
  • Utilizar los motores llama.cpp y MLX.
  • Conversar mediante la interfaz de LM Studio.
  • Utilizar el agente Bionic con las limitaciones del plan gratuito.
  • Realizar transcripción de voz local.
  • Utilizar LM Link hasta en cinco dispositivos.
  • Acceder de manera limitada a algunas funciones de búsqueda web.

Por tanto, no es necesario contratar una suscripción para instalar LM Studio, descargar un modelo compatible y ejecutarlo mediante la CPU, la memoria RAM o una GPU propia.

Una vez descargado el modelo, la generación local no se factura por consultas, minutos ni tokens. Podemos mantener conversaciones tan largas o numerosas como permita nuestro hardware, sin necesidad de adquirir créditos.

¿Por qué aparecen planes de pago?

LM Studio ha incorporado Bionic, una modalidad que combina la inteligencia artificial local con servicios opcionales ejecutados en la nube. Los planes ofrecidos actualmente son:

PlanPrecio indicadoCaracterísticas principales
Free0 dólaresModelos locales y funciones básicas
Bionic+20 dólares al mesModelos abiertos alojados en servidores, búsqueda web y extracción de páginas
Pro100 dólares al mesLímites de uso superiores y acceso anticipado a determinadas funciones

Los planes Bionic+ y Pro están destinados principalmente a quienes desean utilizar modelos más grandes ejecutados en servidores externos, realizar más búsquedas web o disponer de mayores límites de uso.

Estos servicios son opcionales. No es necesario contratarlos para seguir utilizando modelos locales mediante LM Studio. La diferencia fundamental es la siguiente:

Ejecución localEjecución mediante Bionic
Utiliza nuestra CPU, RAM o GPUUtiliza servidores externos
No se paga por tokenPuede estar sujeta a cuotas, límites o créditos
Puede funcionar sin InternetNecesita conexión
Los datos permanecen en el ordenadorLas consultas se procesan externamente
El rendimiento depende de nuestro equipoPermite acceder a modelos más exigentes
Consume electricidad localmenteEl procesamiento lo realiza el proveedor

La información actualizada sobre estos planes puede consultarse en la página oficial de precios de LM Studio.

¿Los modelos descargados también son gratuitos?

LM Studio es la aplicación utilizada para ejecutar los modelos, pero no es necesariamente el creador ni el propietario de ellos. La mayoría de los modelos disponibles en su buscador proceden de Hugging Face y han sido publicados por organizaciones o desarrolladores externos.

Entre los modelos abiertos que habitualmente pueden descargarse y ejecutarse localmente encontramos familias como:

  • Qwen.
  • Llama.
  • Mistral.
  • Gemma.
  • DeepSeek.
  • gpt-oss.
  • Phi.

En la mayoría de los casos, descargar sus pesos y utilizarlos localmente no requiere realizar ningún pago. Sin embargo, cada modelo se distribuye bajo su propia licencia. Por este motivo, antes de utilizarlo debemos comprobar:

  • Si permite uso personal.
  • Si admite utilización académica.
  • Si puede emplearse comercialmente.
  • Si exige algún tipo de atribución.
  • Si impone restricciones sobre determinados usos.
  • Si requiere aceptar previamente una licencia.
  • Si la cuantización descargada procede de una fuente fiable.

Los términos «modelo abierto», «pesos abiertos» y «software libre» no significan exactamente lo mismo. Un modelo puede permitir descargar sus pesos sin que todos sus componentes, datos de entrenamiento o licencia sean completamente abiertos.

Para realizar pruebas personales, traducciones, programación, redacción o investigación propia, generalmente encontraremos numerosos modelos gratuitos. No obstante, si el modelo va a incorporarse a un producto comercial o a ofrecerse como servicio, resulta imprescindible revisar su licencia concreta.

¿Puede haber modelos de pago?

Sí, aunque debemos distinguir diferentes situaciones. Un modelo puede utilizarse mediante:

  • Descarga gratuita de sus pesos.
  • Acceso condicionado al registro y aceptación de una licencia.
  • Una API comercial que cobra por tokens.
  • Un servicio en la nube con suscripción.
  • Un proveedor externo que cobre por alojarlo y ejecutarlo.
  • Una licencia comercial específica.

En LM Studio podemos encontrar principalmente modelos descargables cuyos archivos se ejecutan localmente. No obstante, Bionic también ofrece acceso a modelos alojados en la nube, cuyo uso puede estar incluido en una suscripción o consumir créditos.

Por tanto, antes de descargar o utilizar un modelo conviene comprobar si aparece identificado como: Local o como: Cloud. Para mantener el uso completamente gratuito y privado debemos seleccionar un modelo local, descargar sus pesos y ejecutarlo utilizando los recursos de nuestro propio ordenador.

Costes indirectos de la inteligencia artificial local

Aunque LM Studio y muchos modelos puedan utilizarse sin pagar una suscripción, la ejecución local no carece completamente de costes. Debemos considerar:

  • El consumo eléctrico del ordenador.
  • El espacio ocupado en el NVMe o SSD.
  • El tiempo necesario para descargar los modelos.
  • La carga prolongada del procesador.
  • La refrigeración y ventilación del equipo.
  • El desgaste derivado de un funcionamiento intensivo.
  • El coste inicial del hardware.

Un modelo de 8B cuantizado puede ocupar aproximadamente entre 5 y 7 GB, mientras que uno de 32B puede superar los 20 GB. Si descargamos diferentes cuantizaciones y modelos, el espacio utilizado puede crecer rápidamente.

En el caso del Xeon E5-2680 v4, el procesador tiene un TDP de 120 W. Esto no significa que consuma exactamente 120 W en todo momento, pero durante una generación prolongada puede trabajar con una carga elevada. Es recomendable disponer de una refrigeración adecuada y vigilar las temperaturas.

A pesar de estos costes indirectos, para un usuario que ya posee el ordenador, ejecutar modelos locales puede resultar económicamente interesante porque no existe una factura asociada al número de consultas.

Funcionamiento completamente local y sin conexión

Después de instalar LM Studio y descargar tanto el motor como el modelo, las funciones esenciales pueden utilizarse sin conexión a Internet. Según la documentación oficial, no necesitan conexión:

  • La ejecución de modelos descargados.
  • Las conversaciones locales.
  • El procesamiento local de documentos.
  • La utilización del servidor local.
  • La generación de texto.

Sí requieren conexión:

  • Buscar modelos en la sección Discover.
  • Descargar nuevos modelos.
  • Descargar o actualizar los motores de ejecución.
  • Buscar actualizaciones de LM Studio.
  • Utilizar funciones de búsqueda web.
  • Acceder a los modelos de Bionic alojados en la nube.

LM Studio afirma que el contenido introducido al conversar con un modelo local no abandona el dispositivo. Asimismo, los documentos adjuntados para realizar consultas o RAG se procesan localmente.

Podemos comprobarlo con una prueba sencilla:

  1. Descargar el modelo.
  2. Cargarlo y comprobar que responde.
  3. Cerrar LM Studio.
  4. Desconectar temporalmente el ordenador de Internet.
  5. Volver a abrir la aplicación.
  6. Cargar el mismo modelo.
  7. Mantener una conversación.

Si el modelo sigue funcionando, estaremos utilizando la inferencia local. Esto no significa que cualquier documento pueda procesarse libremente. Cuando trabajemos con información confidencial, manuscritos no publicados, datos personales o documentación de terceros, también tendremos que respetar las condiciones contractuales, legales, profesionales o editoriales aplicables.

¿Es necesario crear una cuenta o contratar un plan?

Para las funciones locales básicas no debería ser necesario contratar un plan de pago. La descarga de modelos desde Hugging Face puede realizarse directamente desde el buscador de LM Studio, aunque algunos repositorios concretos podrían solicitar una cuenta o la aceptación previa de su licencia. Durante la instalación debemos diferenciar cuidadosamente entre:

  • La aplicación local.
  • El modelo descargado.
  • Los servicios Bionic.
  • Las funciones de búsqueda web.
  • Las API externas.
  • Los complementos o servidores MCP.

Si nuestro objetivo es obtener la máxima privacidad, podemos limitarnos a la aplicación, el motor llama.cpp y un modelo GGUF local. No será necesario activar servicios externos, búsqueda web ni modelos en la nube.

En resumen, LM Studio puede instalarse y utilizarse gratuitamente para ejecutar modelos locales. Los precios mostrados en su web corresponden principalmente a servicios adicionales en la nube, mayores límites de uso y otras prestaciones opcionales. Para el ordenador utilizado en este artículo podemos descargar un modelo GGUF gratuito, cargarlo en los 64 GB de RAM y generar texto sin pagar ninguna cuota por consulta.

Requisitos mínimos

Antes de instalarlo conviene comprobar los siguientes puntos:

  • Windows 10 u 11 de 64 bits.
  • Procesador compatible con AVX2.
  • Un mínimo recomendable de 16 GB de RAM.
  • Espacio suficiente en el disco.
  • Conexión a Internet para descargar inicialmente la aplicación, el motor y los modelos.

No todos los procesadores antiguos incluyen AVX2. Puede comprobarse buscando el modelo exacto del procesador en la página del fabricante o utilizando CPU-Z.

La ausencia de una tarjeta gráfica dedicada no impide usar LM Studio, pero limita el tamaño práctico del modelo y reduce la velocidad.

Descargar e instalar LM Studio

El primer paso consiste en acceder a la web oficial: Descargar LM Studio

Debemos seleccionar la versión para Windows y ejecutar el instalador descargado. Una vez finalizada la instalación, abrimos la aplicación.

LM Studio puede mostrar diferentes niveles de interfaz. Para acceder a todos los parámetros es recomendable seleccionar el modo Power User. También se puede cambiar el idioma desde:

Settings → Preferences → Language

La aplicación dispone de traducción al español. En Windows, la configuración puede abrirse mediante el atajo Ctrl + ,.

Descargar el primer modelo

Dentro de LM Studio encontraremos una sección denominada Discover. Desde ella se pueden buscar y descargar modelos compatibles.

Como primera prueba para un ordenador sin GPU dedicada podemos buscar:

Qwen3 8B GGUF

Es importante elegir una versión destinada a conversación o instrucciones. Dependiendo del modelo, puede aparecer con términos como:

Instruct
Chat
GGUF

No conviene descargar automáticamente el archivo más grande. Un mismo modelo puede ofrecerse en diferentes cuantizaciones, identificadas mediante nombres como:

Q3_K_S
Q4_K_M
Q5_K_M
Q6_K
Q8_0

¿Qué significa la cuantización?

Los modelos utilizan millones o miles de millones de parámetros. La cuantización reduce el número de bits empleados para almacenar esos parámetros, disminuyendo el tamaño del archivo y la memoria necesaria.

Una cuantización de cuatro bits permite ejecutar modelos relativamente grandes con una pérdida moderada de calidad.

Para comenzar, la opción más equilibrada suele ser:

Q4_K_M

LM Studio recomienda escoger una cuantización de cuatro bits o superior cuando el ordenador tenga capacidad suficiente.

A modo orientativo:

ModeloTamaño aproximado en Q4Uso recomendado
3–4B2–4 GBEquipos modestos
7–8B5–7 GBPrimera opción sin GPU
12–14B9–12 GBMayor calidad, menor velocidad
20–24B13–20 GBEquipos con 32–64 GB
30–32B20–26 GBPosible con 64 GB, pero lento
70B45–55 GBPoco práctico sin GPU

Estas cifras no incluyen toda la memoria adicional empleada por el contexto, la caché y el propio sistema operativo.

¿Qué modelo conviene elegir?

Para el equipo con Xeon E5-2680 v4 y 64 GB empezaríamos mejor por un modelo de 8B. Una posible secuencia de pruebas sería:

  1. Qwen3 8B en formato GGUF y cuantización Q4_K_M.
  2. Qwen3 14B Q4_K_M.
  3. gpt-oss 20B.
  4. Algún modelo de 30B o 32B, si se acepta una respuesta más lenta.

Un modelo de 8B es adecuado para:

  • Consultas generales.
  • Traducción.
  • Resumen de textos propios.
  • Corrección de redacción.
  • Explicaciones técnicas.
  • Ayuda con programación.
  • Organización de ideas.
  • Clasificación y extracción de información.

Los modelos de 14B o 20B pueden mejorar la coherencia y el razonamiento, pero requieren más memoria y tardan más en generar cada respuesta.

No recomendaríamos comenzar con un modelo de 70B. Aunque una versión muy cuantizada podría llegar a caber en 64 GB, su funcionamiento mediante esta CPU sería demasiado lento para una conversación cómoda.

Cargar el modelo en memoria

Una vez descargado, hay que ir a la pestaña Chat y abrir el selector situado en la parte superior. Desde ahí elegiremos el modelo instalado.

Cargar un modelo significa copiar sus parámetros desde el NVMe hasta la memoria RAM. Este proceso puede tardar varios segundos. Cuando termina, se puede escribir una consulta en la zona inferior de la ventana.

Como configuración inicial para el Xeon E5-2680 v4 utilizamos:

  • Modelo: Qwen3 8B Instruct.
  • Formato: GGUF.
  • Cuantización: Q4_K_M.
  • Longitud de contexto: 8192 tokens.
  • Hilos de CPU: 14.
  • Capas descargadas en GPU: 0.
  • Temperatura: 0,6 o 0,7.
  • Tamaño máximo de respuesta: entre 1024 y 2048 tokens.

¿Cuántos hilos de CPU deben utilizarse?

El Xeon E5-2680 v4 tiene 14 núcleos físicos y 28 hilos gracias a Hyper-Threading. Utilizar los 28 hilos no garantiza una generación más rápida.

Como punto de partida configuraremos:

CPU Threads: 14

Después podemos comparar el rendimiento con 12, 16, 20 y 28 hilos. La mejor configuración dependerá del motor utilizado, del modelo y del resto de procesos activos.

Mientras se genera una respuesta, el Administrador de tareas de Windows permite observar el uso del procesador y de la memoria:

Ctrl + Mayús + Esc

Conviene vigilar también la temperatura. El Xeon E5-2680 v4 tiene un consumo térmico nominal de 120 W, por lo que necesita un disipador adecuado durante cargas prolongadas.

Configurar la longitud de contexto

La longitud de contexto determina cuánta información puede mantener el modelo simultáneamente. Incluye:

  • Las instrucciones iniciales.
  • Las preguntas anteriores.
  • Las respuestas generadas.
  • Los documentos añadidos.
  • El nuevo mensaje del usuario.

El contexto se mide en tokens. Como aproximación, un token representa alrededor de tres cuartas partes de una palabra en inglés, aunque la relación cambia según el idioma. Un contexto mayor permite trabajar con conversaciones o documentos más largos, pero aumenta el consumo de memoria y puede reducir el rendimiento.

Para empezar resulta prudente utilizar:

Context Length: 8192

Si se necesita procesar un documento más extenso, puede probarse con 16384 o 32768 tokens, siempre que la memoria utilizada siga siendo razonable. No conviene establecer el máximo disponible simplemente porque el modelo lo admita.

Primera prueba de funcionamiento

Podemos comenzar con una consulta sencilla:

Explícame en español qué es una red neuronal artificial y proporciona un ejemplo aplicado a la monitorización de energía eléctrica.

Después podemos probar una tarea de redacción:

Corrige el siguiente párrafo conservando su significado técnico y enumera los cambios realizados.

Finalmente, puede solicitarse una respuesta estructurada:

Compara en una tabla las ventajas y limitaciones de ejecutar un modelo de inteligencia artificial localmente frente a utilizar un servicio en la nube.

En la interfaz pueden aparecer estadísticas como:

  • Tiempo hasta el primer token.
  • Tokens generados por segundo.
  • Número total de tokens.
  • Memoria utilizada.

Estas cifras permiten comparar modelos y configuraciones.

Rendimiento esperable con el Xeon E5-2680 v4

Sin una prueba directa no se puede garantizar una velocidad concreta, pero pueden utilizarse los siguientes valores como referencia aproximada:

Tamaño del modeloVelocidad orientativa
7–8B Q46–12 tokens por segundo
12–14B Q43–7 tokens por segundo
20B Q42–6 tokens por segundo
30–32B Q41–3 tokens por segundo
70B Q4Menos de 1–1,5 tokens por segundo

La velocidad real depende de la cuantización, el contexto, la frecuencia efectiva del procesador, los canales de memoria y la versión del motor.

Un modelo de 8B puede producir texto a una velocidad cómoda. Uno de 32B puede ofrecer respuestas mejores, pero será necesario esperar más.

Conversaciones y documentos locales

LM Studio permite crear diferentes conversaciones y organizarlas en carpetas. También ofrece vista dividida para comparar dos chats o modelos.

Además, se pueden adjuntar archivos .pdf, .docx y .txt. Si el documento cabe dentro del contexto, puede incorporarse completo. Cuando es demasiado largo, LM Studio puede recurrir a un sistema RAG, que localiza y proporciona al modelo los fragmentos más relacionados con la consulta.

Según LM Studio, este procesamiento se realiza localmente y el documento no abandona la aplicación. Aun así, antes de introducir información reservada deben comprobarse las normas contractuales, profesionales o editoriales aplicables. Que una herramienta funcione sin conexión no significa automáticamente que esté autorizado utilizarla con cualquier documento.

Cómo comprobar que funciona sin Internet

Una vez descargados el programa, el motor y el modelo, podemos cerrar LM Studio, desconectar temporalmente la conexión de red y volver a abrirlo. El modelo descargado debe poder cargarse y responder normalmente. Sin conexión no estarán disponibles:

  • La búsqueda de nuevos modelos.
  • La descarga de modelos.
  • La descarga o actualización de motores.
  • Las actualizaciones de LM Studio.
  • Cualquier servicio externo añadido posteriormente.

Sí seguirán funcionando:

  • Los modelos ya descargados.
  • Las conversaciones locales.
  • Los documentos procesados localmente.
  • El servidor local.
  • La generación de texto.

Más información en la documentación sobre el funcionamiento sin conexión de LM Studio.

Privacidad y seguridad

La privacidad es una de las principales razones para ejecutar modelos en local, pero conviene adoptar algunas precauciones:

  • Descargar LM Studio únicamente desde su página oficial.
  • Elegir modelos procedentes de repositorios conocidos.
  • Revisar la licencia de cada modelo.
  • Mantener Windows y LM Studio actualizados.
  • No activar complementos ni servidores externos innecesarios.
  • Limitar el servidor local a localhost si no debe accederse desde otros ordenadores.
  • Cifrar la unidad cuando se maneje información sensible.
  • No sincronizar automáticamente la carpeta de conversaciones con servicios en la nube.
  • Eliminar los chats y documentos cuando dejen de ser necesarios.
  • Mantener copias de seguridad de la información importante.
  • Verificar siempre las respuestas generadas.

Los modelos no aprenden de forma permanente a partir de cada conversación. LM Studio aclara que el modelo solo conoce el contenido que se encuentra en el contexto del chat o en las instrucciones proporcionadas durante la sesión.

Problemas frecuentes

LM Studio no se instala o no inicia:La causa puede ser un procesador sin AVX2. Hay que comprobar las instrucciones compatibles con la CPU.

El modelo no puede cargarse:Probablemente no haya suficiente RAM disponible. Podemos cerrar otros programas, reducir el contexto o descargar una cuantización más pequeña.

El ordenador responde muy lentamente: Conviene probar un modelo con menos parámetros, utilizar Q4_K_M, reducir el contexto y ajustar el número de hilos.

La memoria se llena: No debemos elegir un modelo cuyo archivo ocupe prácticamente toda la RAM. Windows, la caché del contexto y LM Studio también necesitan memoria.

El modelo responde en inglés:Podemos escribir una instrucción inicial como:

Responde siempre en español, salvo que te solicite expresamente otro idioma.

LM Studio también permite guardar instrucciones o configuraciones para reutilizarlas.

Las respuestas son incorrectas: Los modelos de lenguaje pueden inventar datos. Debemos pedir explicaciones verificables, comprobar las referencias y no aceptar automáticamente cifras, nombres o conclusiones.

El modelo pierde información del comienzo:La conversación probablemente ha superado la longitud de contexto. Se puede iniciar un nuevo chat, resumir la conversación o aumentar moderadamente el contexto.

LM Studio frente a ChatGPT

Aunque su aspecto es parecido, no son exactamente equivalentes.

CaracterísticaLM Studio con modelo localServicio de IA en la nube
ProcesamientoEn el ordenadorEn servidores externos
InternetNo es necesario tras la descargaNormalmente obligatorio
PrivacidadMayor control localDepende del servicio
VelocidadDepende del hardwareGeneralmente superior
Calidad máximaLimitada por el modelo elegidoAcceso a modelos avanzados
Coste por consultaNoPuede existir suscripción o límites
InstalaciónNecesariaNo necesaria
Consumo eléctricoLo asume el ordenador localLo asume el proveedor
ActualizaciónManualGestionada por el proveedor

LM Studio no pretende sustituir en todos los casos a los modelos comerciales. Su interés reside en proporcionar control, privacidad, experimentación y funcionamiento autónomo.

¿Merece la pena utilizar IA local sin GPU?

La respuesta depende del uso previsto. Para traducción, redacción, programación, resumen de documentos propios, clasificación de textos y consultas técnicas, un modelo de 8B o 14B puede resultar muy útil.

El Xeon E5-2680 v4 no es un procesador reciente, pero sus 14 núcleos, el soporte AVX2, los cuatro canales de memoria y los 64 GB de RAM permiten reutilizarlo como una plataforma razonable para experimentar con inteligencia artificial local.

La unidad NVMe agiliza la carga y el espacio disponible permite mantener varios modelos instalados. No obstante, para obtener una conversación fluida conviene elegir modelos moderados y cuantizados, en lugar de intentar ejecutar el modelo más grande que pueda caber en memoria.

Conclusión

Ejecutar un modelo de inteligencia artificial en local ya no está reservado a grandes servidores equipados con costosas tarjetas gráficas. Un ordenador con Windows 11, procesador compatible con AVX2 y suficiente memoria RAM puede utilizar aplicaciones como LM Studio para descargar y ejecutar modelos abiertos mediante una interfaz similar a ChatGPT.

En el equipo analizado, formado por una placa HUANANZHI X99 QD4, un Xeon E5-2680 v4, 64 GB de RAM DDR4 ECC y una unidad NVMe, la configuración inicial recomendada es un modelo de aproximadamente 8B parámetros en formato GGUF y cuantización Q4_K_M, con 8192 tokens de contexto y 14 hilos de CPU.

A partir de esta base se pueden probar modelos de 14B o 20B y comparar la calidad, velocidad y consumo de memoria.

La IA local no elimina la necesidad de revisar cuidadosamente los resultados, pero ofrece una alternativa interesante para quienes desean experimentar, proteger sus datos y aprovechar ordenadores que todavía cuentan con una buena cantidad de memoria y capacidad de procesamiento.

Reacciones en fediverso

Deja un comentario

Este sitio utiliza Akismet para reducir el spam. Conoce cómo se procesan los datos de tus comentarios.