Guia Completa d'IA Local: Com instal·lar i utilitzar models amb GUI, CLI i API

Darrera actualització: setembre 30, 2026
  • La inferència local elimina la dependència del núvol, garantint privadesa total i costos zero per token.
  • Eines com Ollama i LM Studio faciliten el desplegament de models quantitzats GGUF en maquinari domèstic.
  • La memòria RAM i VRAM són els factors crítics per determinar quina mida de model pot executar cada equip.

Interfície de programació i servidors locals, il·lustrant la configuració d'API i CLI per a la gestió de models d'IA.

Fa tot just un parell d'anys, intentar muntar un model de llenguatge potent a casa era un autèntic malson. Et passaves hores barallant-te amb les versions de PyTorch , instal·lant dependències de CUDA que no encaixaven i gestionant quantitzacions a mà, perquè al final el chatbot fos lentíssim i només servís per fer una demo ràpida. Per sort, aquesta època ja ha passat i avui comptem amb una infraestructura madura on tot flueix molt millor.

Actualment, el panorama ha canviat radicalment. Ja no necessites ser un expert en sistemes per tenir una IA funcionant; hi ha aplicacions que gestionen tot el cicle, des de la descàrrega del model fins a la creació d'un servidor API compatible amb OpenAI, amb només un clic . El catàleg de models oberts ha crescut exponencialment, permetent triar entre opcions com Llama, Gemma, Qwen o Mistral segons el que necessitem en cada moment.

Google Chrome instal·la un model d'IA de 4 GB
Article relacionat:
Google Chrome instal·la en silenci un model d'IA local de 4 GB

Què implica realment executar una IA local?

Quan parlem de IA local, ens referim que tot el procés —els pesos del model, la inferència i la gestió dels teus prompts— passa dins del teu maquinari . No hi ha dades que viatgin a servidors externs, per la qual cosa les vostres converses i documents mai arriben a mans de gegants com Google o OpenAI. Això és una benedicció per als que manegen dades sota acords de confidencialitat (NDA) , expedients mèdics o codi propietari d'empresa que no poden sortir de la xarxa interna.

A més de la privadesa, hi ha altres punts forts. D'una banda, el compliment del RGPD és immediat , ja que no hi ha transferències internacionals de dades. De l'altra, t'oblides de les factures mensuals per milió de tokens; una vegada que tens el PC, lús és totalment gratuït. També és la solució ideal per treballar en mode offline, ja sigui en un avió o en zones amb una connexió internet que deixa molt a desitjar. Això sí, cal ser realistes: els models tancats d'avantguarda continuen tenint una capacitat de raonament complex superior , per la qual cosa el més intel·ligent és combinar els dos mons segons la tasca.

  Domòtica a la llar: guia completa per a una llar intel·ligent

El maquinari: la clau és a la memòria

Si hi ha alguna cosa que has de gravar a foc és que els LLM són autèntics golafres de memòria. Tot i això, ja no tot depèn de tenir una targeta gràfica caríssima. Gràcies a avenços com truca.cpp , ara podem aprofitar molt millor la CPU i la RAM del sistema.

Ecosistema Apple Silicon

Estació de treball moderna amb Mac Studio i monitor, representant el maquinari eficient d'Apple Silicon per a IA local.

Els Mac amb xips M són, possiblement, l'opció més eficient per a portàtils a causa de la seva arquitectura de memòria unificada . Això permet que la GPU accedeixi a tota la RAM del sistema sense haver de copiar dades, cosa que els dóna un avantatge brutal. Per exemple, un equip amb 16 GB pot moure models de fins a 8B paràmetres còmodament, mentre que els models Max amb 64 ​​GB o més poden executar models de fins a 70B amb quantitzacions agressives, apropant-se a la qualitat de models professionals a casa.

PC amb GPU dedicada

PC d'alt rendiment amb GPU dedicada i monitor amb codi, ideal per executar models de llenguatge locals a Windows o Linux.

Al món Windows o Linux, el rei és la VRAM de la targeta gràfica. Si tens una RTX 3060 de 12 GB o una 4060 Ti de 16 GB, pots manejar models de 7B a 13B sense problemes. Per als que busquen potència bruta, una RTX 4090 amb 24 GB de VRAM és la joia de la corona, permetent córrer models de 30B sense quantitzar o models de 70B optimitzats. Si muntaràs un equip des de zero, el més equilibrat avui dia és un Mac mini M4 Pro amb 48 GB o un PC amb una RTX 4070 Super.

  Suite ofimàtica en línia: guia completa i opcions destacades

Eines imprescindibles: CLI, GUI i Runtimes

Espai de treball amb doble monitor i PC potent, representant el flux de treball amb interfícies gràfiques (GUI) de IA local.

Per engegar la IA, tenim diverses rutes depenent de quanta fricció vulguem en el procés.

  • Ollama: És el motor preferit de molts. És un runtime lleuger que funciona principalment via CLI i ofereix una API REST compatible amb OpenAI. És ideal si busques rapidesa i simplicitat per servir models en segon pla i connectar altres aplicacions a través del port 11434.
  • LM Studio: Per als que fugen de la terminal, aquesta és la millor opció. Ofereix una interfície visual impecable, un catàleg on podeu veure els ratings dels models i un servidor local integrat. A Mac, destaca per fer servir el motor MLX d'Apple, aconseguint velocitats superiors a llama.cpp.
  • Gener: Una alternativa open-source i auditable que permet alternar entre models locals i APIs al núvol (BYOK), encara que sol ser una mica menys polida que LM Studio.
  • llama.cpp: És el motor base a C++ que fa que tot això funcioni. Si ets un usuari avançat i vols esprémer fins al darrer percentatge de rendiment ajustant flags, vés directe a la font.

Entenent els models i el format GGUF

Perquè un model gegant càpiga en un ordinador domèstic, s'utilitza la quantització , que bàsicament comprimeix els pesos del model. El format estàndard per a això és el GGUF , que empaqueta tot el necessari (pesos, tokenitzador i metadades) en un sol fitxer. Una quantització Q4_K_M sol ser el punt dolç, ja que redueix la mida del model en un 70% mantenint una qualitat gairebé idèntica al model original.

A lhora de triar, els models de 7B o 8B paràmetres són lestàndard per a ús general en màquines amb 16 GB de RAM. Si necessites una mica més especialitzat, hi ha variants per a codi o raonament matemàtic. L'ideal és començar amb una quantització Q5 o Q6, i baixar a Q4 només si notes que la memòria queda curta i el sistema comença a anar lent.

  iOS 26.2 activa la traducció en viu amb AirPods a la Unió Europea

Integració al flux de treball i desenvolupament

Infraestructura de servidors a un centre de dades, representant la inferència d'IA centralitzada a escala empresarial.

Tenir el model corrent és només el principi. Perquè sigui útil en el dia a dia, convé utilitzar clients descriptori com Cherry Studio, Msty o Llevant . Aquestes eines permeten gestionar l'historial de xats, fer servir prompts reutilitzables i connectar servidors MCP perquè la IA accedeixi als teus correus, Slack o GitHub. A més, permeten saltar entre un model local i un de núvol a la mateixa conversa, usant el local per a dades sensibles i el de núvol per a tasques de raonament extrem.

Per als desenvolupadors, hi ha llibreries com OllamaSharp o LlamaSharp que permeten integrar aquestes capacitats directament en aplicacions de C#. Pots optar per fer trucades HTTP a un servidor d'Ollama o carregar el model directament a la memòria de la teva aplicació usant el backend de CPU, eliminant qualsevol dependència de serveis externs.

A nivell empresarial, la cosa escala. No pots demanar a cada empleat que gestioni la seva pròpia instància d'Ollama. El més lògic és muntar un servidor d'inferència centralitzat amb maquinari potent (com estacions amb doble A6000) i gestionar l'accés mitjançant una plataforma que controli els logs, els límits d'ús i la seguretat de les dades, mantenint així el control total de la infraestructura.

Tenir una IA local actualment és una decisió intel·ligent per a qualsevol que valori la privadesa o vulgui evitar els costos recurrents de les subscripcions. Des de la senzillesa d'instal·lar Ollama i baixar un model Truca en deu minuts, fins a la complexitat de fer un fine-tuning amb dades pròpies per crear un especialista en un domini concret, les possibilitats són enormes. Encara que els models tancats segueixin liderant la frontera tecnològica, la bretxa es tanca i l'ecosistema d'eines GUI i CLI fa que tenir el cervell de la IA al teu disc dur sigui més accessible i potent que mai.