// les carnets vivants · mis à jour en continu
Les carnets vivants
Des guides pratiques qu'on relit et qu'on corrige au lieu de les laisser vieillir. Dès qu'un outil change de version ou qu'on trouve mieux, le carnet suit.
Fine-tuner un LLM sur Apple Silicon avec MLX
Le fine-tuning passe pour une affaire de fermes de GPU. MLX, le framework de machine learning d'Apple, le rend pourtant accessible sur un simple Mac : un MacBook M1 de 2020 avec 8 Go de RAM suffit pour spécialiser un petit modèle en une trentaine de minutes. Voici la chaîne complète, du choix du modèle à l'entraînement LoRA, avec les commandes qui vont avec.
Spec Kit : cadrer ce que l'IA doit coder avant qu'elle ne le code
Les agents de code produisent vite, et parfois autre chose que ce qu'on avait en tête. Le code est propre, il tourne, il est presque bon. Spec Kit, l'outil open source de GitHub (plus de 131 000 étoiles), attaque ce « presque » en imposant un cadre : écrire ce qu'on veut construire avant de laisser l'agent l'écrire en code.
Les Skills
Recopier le même bloc d'instructions dans le chat à chaque nouvelle session finit par lasser. Un skill décrit la procédure une fois dans un fichier, et l'agent va la chercher lui-même quand la tâche s'y prête.
Claude Code : installer et utiliser l'agent IA d'Anthropic dans son terminal
Claude Code est un agent spécialisé conçu pour travailler directement dans une base de code, depuis le terminal. Il lit les fichiers, propose des modifications, les applique une fois validées, et va jusqu'à créer des commits ou ouvrir des pull requests tout seul. Voici comment l'installer, s'en servir, et les commandes que je tape le plus souvent.
Le RAG : connecter une IA à ses propres documents, sans la réentraîner
Claude, ChatGPT ou Gemini ne connaissent que ce qu'ils ont vu à l'entraînement. Poser une question sur un document interne, un mail récent ou une politique de congés maison ne donne rien, le modèle n'a jamais eu accès à ces textes. Le RAG (Retrieval-Augmented Generation, génération augmentée par la récupération) répond à ce problème sans toucher au modèle. C'est ce qui tourne derrière Gemini Notebook ou Claude Projects quand on leur donne des fichiers à consulter.
Ollama : faire tourner un LLM en local, gratuitement et hors ligne
Avec Claude, ChatGPT ou Gemini, chaque question part vers un serveur tiers. Ollama permet l'inverse. On télécharge un modèle et on le fait tourner directement sur sa machine, sans connexion et sans frais. L'outil est open source, avec plus de 177 000 étoiles sur GitHub, et sert de gestionnaire pour télécharger, lancer et supprimer des modèles en local.
Warp : qu'est-ce que ce terminal propulsé par l'IA ?
Warp est un terminal accéléré par le GPU qui remplace le flux de texte continu par des blocs, une palette de commandes et des workflows partageables. Voici comment il fonctionne, et ce que j'en retiens après l'avoir adopté au quotidien.