Sur ton propre laptop, un petit modèle d’IA peut déjà traiter du texte et des images et répondre à tes questions, sans avoir besoin d’un compte cloud. Le modèle qwen3.5:4b-q4_K_M (Qwen) peut faire exactement la même chose dès ce soir sur un laptop ordinaire avec 16 Go de mémoire, après un téléchargement de 3,4 Go. C’est un LLM, ou grand modèle de langage. Télécharge-le via Ollama, pose-lui une question avec un contexte de 4K, et tu fais déjà tourner un vrai modèle d’IA en local sur le matériel que tu as déjà. Il lit du texte et des images, et ici, on parle d’inférence, pas d’entraînement. On ne lui apprend rien de nouveau : il se contente de répondre.
Le vague autocollant « AI PC » sur la boîte d’un laptop ne remplace pas une fiche technique. Ce qui compte, c’est la RAM, la mémoire exploitable par le GPU, le stockage et la compatibilité logicielle réelle. Avec 16 Go de mémoire, tu as déjà un vrai point d’entrée pour les petits modèles d’IA. Ce n’est ni un minimum à écarter d’office, ni la promesse de tout ce qu’annonce une fiche technique. Plus de mémoire, c’est plus de contexte et davantage de marge pour le multitâche. Avec 16 Go, tu peux déjà commencer.
La taille du fichier téléchargé et l’empreinte mémoire du modèle une fois lancé sont deux choses bien différentes. Les confondre, c’est de loin l’erreur la plus fréquente quand on cherche un laptop pour l’IA. Les 3,4 Go que tu télécharges pour le modèle qwen3.5:4b-q4_K_M correspondent au fichier stocké sur le disque. Pour le charger, il faut de la vraie mémoire. Il en faut aussi pour la fenêtre de contexte, autrement dit la conversation en cours que le modèle garde en tête pendant qu’il répond, ce qu’on appelle le cache KV. Et il en faut encore pour le moteur lui-même, sans compter ce que ton système d’exploitation et tes autres applis utilisent déjà.
Par défaut, Ollama charge un contexte de 4 096 tokens, et tu peux l’augmenter. Si tu exécutes plusieurs requêtes en parallèle, la mémoire nécessaire pour le contexte augmente à peu près au même rythme que le nombre de requêtes simultanées. La fiche technique d’un modèle peut annoncer une fenêtre de contexte de 128K ou 256K tokens : vois-y le plafond du modèle, pas la promesse que ton laptop de 16 Go pourra exploiter toute cette capacité d’un coup.
Les puces Apple Silicon utilisent une mémoire unifiée : le CPU et le GPU partagent une mémoire de 16, 24 ou 32 Go. Il n’y a donc pas de mémoire graphique séparée qui puisse venir à manquer. Sur un laptop Windows ou Linux classique équipé d’un GPU NVIDIA dédié, c’est différent. La RAM système et la VRAM du GPU sont deux mémoires distinctes, et 16 Go de RAM système avec un GPU de 8 Go ne constituent pas un seul bloc de 24 Go qu’un modèle peut utiliser librement.
Quand un modèle ne tient pas entièrement sur le GPU, une partie s’exécute sur le CPU. Cette répartition partielle peut rendre un modèle techniquement chargeable nettement plus lent à l’usage. Exécute la commande ollama ps et tu verras précisément la répartition CPU/GPU du modèle actuellement chargé.
La capacité ne fait pas tout. La vitesse à laquelle les données circulent dans cette mémoire compte tout autant : Apple annonce 153 Go/s de bande passante mémoire sur le MacBook Air M5, et c’est aussi grâce à cette bande passante, pas seulement à la quantité de mémoire, que l’appareil reste fluide au quotidien plutôt que simplement suffisant sur le papier.
La quantification, c’est ce qui se cache derrière ce téléchargement de 3,4 Go : en stockant les poids d’un modèle avec une précision numérique plus faible, on réduit la taille du fichier. Et le modèle 9B de Qwen3.5 illustre très bien l’écart possible. Le même modèle 9B se télécharge en 6,6 Go en Q4_K_M, en 11 Go en Q8_0, et en 19 Go en pleine précision BF16. Même modèle, même nombre de paramètres, trois tailles de téléchargement très différentes. Et là encore, il s’agit de la taille du fichier, pas de la RAM nécessaire pendant l’exécution.
En général, une précision plus faible entraîne une petite perte de qualité, mais son ampleur dépend de la tâche, pas d’un pourcentage fixe. Autre détail concret à connaître avant de choisir Qwen comme premier modèle : certains utilisateurs signalent que son étape de « réflexion » ajoute un délai sensible avant l’affichage de la réponse, comparé à des modèles qui répondent plus directement. Mieux vaut tester les deux approches sur tes propres usages plutôt que de partir du principe que l’une est forcément meilleure.
Si tu as déjà un MacBook 16 Go, commence par un modèle 2–4B en précision Q4 avec un contexte de 4K avant d’envisager le moindre achat. Un modèle 9B en Q4, ou quelque chose comme Gemma 4 12B QAT, peut aussi se charger. Que cela fonctionne ou non dépend du nombre d’applis déjà ouvertes, de la quantité de contexte utilisée et de la charge thermique actuelle de la machine. Vois donc ça comme une piste à tester, pas comme une garantie.
Tu veux acheter un modèle neuf spécialement pour ça ? Le MacBook Air 13 pouces avec puce M5 est livré de série avec 16 Go de mémoire unifiée et peut être configuré jusqu’à 32 Go. Et avant de te laisser tenter par le plus grand écran en guise de mise à niveau, un point à garder en tête : le modèle M5 Air 15 pouces est proposé avec exactement les mêmes options de 16, 24 et 32 Go de mémoire, ainsi que la même bande passante de 153 Go/s que la version 13 pouces. Choisis la taille d’écran pour le confort, pas en pensant gagner plus de marge pour l’IA. Ce n’est pas le cas.
Un laptop Windows ou Linux de 16 Go sans GPU dédié peut malgré tout faire tourner un petit modèle. Ollama fonctionne nativement sur Windows, alors télécharge un modèle 2–4B en Q4 et essaie-le sur le CPU ou sur la partie graphique intégrée avant de dépenser quoi que ce soit. Attends-toi à plus de variations qu’avec Apple Silicon : aucun chiffre fixe en tokens par seconde ne vaut pour toutes les machines, tout simplement parce que personne n’a mesuré toutes les configurations possibles.
Le Lenovo ThinkPad T14 G2 et le HP EliteBook x360 1040 G7 embarquent tous deux 16 Go de RAM et une partie graphique intégrée : ils entrent exactement dans cette catégorie. Un point à vérifier d’abord, surtout sur une machine reconditionnée plus ancienne comme l’une ou l’autre : LM Studio exige la prise en charge d’AVX2 sous Windows x64, un jeu d’instructions que tous les anciens processeurs ne prennent pas en charge. Vérifie que ton processeur précis le gère avant de supposer que n’importe quel laptop de cette gamme fera tourner l’outil que tu as choisi.
Les GPU NVIDIA pour laptop portent les mêmes noms que les cartes pour PC de bureau, et ce nom en dit moins qu’on ne le croit. Le RTX 5060 Laptop GPU dispose de 8 Go de mémoire GDDR7 et d’une plage de puissance annoncée de 45 à 100 watts. Le RTX 5070 Ti Laptop GPU dispose de 12 Go de GDDR7 et de 60 à 115 watts. Un résultat trouvé en ligne pour une RTX 5070 Ti de PC de bureau n’équivaut pas à un résultat sur une RTX 5070 Ti pour laptop, peu importe ce que le nom laisse penser.
Un deuxième piège se cache dans ce même nom. Deux laptops peuvent tous les deux intégrer un « RTX 5070 Ti Laptop GPU » et pourtant offrir des performances différentes en charge prolongée : un châssis fin et léger et un autre plus épais et plus lourd ne gèrent pas la chaleur de la même manière. Le même nom de GPU ne garantit donc pas la même vitesse réelle après un certain temps d’utilisation soutenue. Vérifie toujours la quantité exacte de VRAM et la configuration de puissance propre au laptop, jamais le seul nom de la famille de GPU.
16 Go restent un point d’entrée utile. Si tu achètes un laptop pour faire tourner régulièrement de l’IA en local, 24 à 32 Go de mémoire unifiée sur Mac te laissent plus de marge pour un modèle plus gros, un contexte plus long et d’autres applis ouvertes. Vise 32 Go si tu comptes t’en servir souvent et que le budget le permet. Sur Windows ou Linux, l’autre configuration à privilégier associe 32 Go de RAM système à un GPU NVIDIA pour laptop doté d’au moins 8 Go de VRAM distincte. Tu peux viser 12 Go de VRAM si un laptop un peu plus lourd ou plus cher te convient.
Avec 8 Go de VRAM, les modèles 4–7B en précision Q4 et un contexte modéré sont une cible plausible, pas une garantie de marge. Même le téléchargement de 6,6 Go d’un modèle 9B en Q4 peut nécessiter plus que les seuls 8 Go de VRAM pour tourner confortablement. Les 12 Go facilitent les essais à cette taille, sans garantir que le modèle tiendra dans toutes les configurations.
Côté reconditionné, le MacBook Pro 13 pouces avec puce M2 illustre le palier supérieur aux 16 Go d’entrée : son CPU à 8 cœurs et son GPU à 10 cœurs s’accompagnent de jusqu’à 24 Go de mémoire unifiée. Sa puce appartient à une génération plus ancienne que celle du MacBook Air M5 : son plafond reste donc de 24 Go, et non les options distinctes de 24 et 32 Go du M5 Air. Le Dell Precision 7730 montre l’autre architecture : ses 32 Go de RAM système et son GPU NVIDIA Quadro P3200 doté de 6 Go de VRAM forment deux réserves de mémoire séparées. Cette carte n’appartient ni à la génération ni à la catégorie des RTX 5060 et 5070 Ti Laptop GPU actuels de NVIDIA. Avec ses 6 Go de VRAM, le Dell illustre la séparation des mémoires, pas la recommandation d’un GPU d’au moins 8 Go.
Un modèle à mélange d’experts 26B/A4B utilise environ 4B paramètres actifs par token. Il faut pourtant stocker ou lire au fil de l’exécution son ensemble de poids, bien plus vaste : pour prévoir la mémoire nécessaire, ce n’est pas un modèle 4B.
Le Gemma 4 E2B présente une autre subtilité dans son nom : il compte 2,3B paramètres linguistiques effectifs, mais 5,1B en incluant les embeddings. Son téléchargement Ollama pèse 7,2 Go, ce qui ne représente pas sa mémoire totale nécessaire pendant l’exécution. Avant d’acheter un laptop sur la foi d’un nombre de paramètres, vérifie le tag exact du modèle, sa précision, la mémoire disponible et le contexte que tu prévois d’utiliser.
Le processeur Ryzen AI Max+ 395 d’AMD prend en charge jusqu’à 128 Go de mémoire système LPDDR5x, selon la configuration retenue sur le laptop final. C’est une architecture mémoire différente qu’il vaut la peine de connaître, avec une vraie limite à garder en tête : la liste de compatibilité ROCm Linux d’Ollama mentionne cette puce, alors que la liste ROCm Windows ne la cite pas à l’heure actuelle.
Voilà une bonne raison de vérifier, sur un laptop précis, la quantité de mémoire installée, le système d’exploitation, le backend GPU, le pilote et le comportement d’Ollama avant de le recommander. Ce n’est pas une raison pour écarter d’emblée cette puce. Considère plutôt un laptop AMD à grande capacité mémoire comme une architecture alternative intéressante à étudier de près, et non comme le premier achat par défaut pour quelqu’un qui débute avec l’IA en local.
Ollama est la solution la plus simple pour échanger avec un modèle sur ta propre machine : tu télécharges un modèle, tu le lances, et tu obtiens un serveur local qui répond aux requêtes, sans compte cloud nécessaire pour un modèle déjà téléchargé. C’est l’outil derrière tous les exemples ici.
LM Studio propose une alternative graphique avec son propre navigateur de modèles et sa fenêtre de chat. L’outil publie ses exigences minimales : au moins 16 Go de RAM sur Mac ou Windows, prise en charge d’AVX2 obligatoire sur Windows x64, et 4 Go de VRAM dédiée recommandés sur Windows. Bien configurer l’un ou l’autre est un sujet à part entière.
Un point de vigilance avant de te fier à un seul chiffre de vitesse vu en ligne : l’outil officiel llama-bench distingue la vitesse de traitement du prompt de la vitesse de génération et publie les variations observées sur plusieurs essais, plutôt qu’un seul nombre. Un message de forum qui cite un seul chiffre de tokens par seconde précise rarement lequel des deux a été mesuré, ni combien de fois le test a été lancé.
Avant d’acheter ou de faire évoluer un laptop spécifiquement pour l’IA en local, vérifie les points concrets plutôt que le marketing.
Modèle exact du GPU et quantité de VRAM. Pas seulement le nom de la famille de GPU : vérifie la variante précise du laptop et sa quantité de mémoire, car un même nom peut cacher plusieurs capacités de VRAM.
RAM soudée ou évolutive. Certains laptops permettent d’ajouter de la mémoire plus tard, beaucoup de modèles fins et légers modernes ne le permettent pas. Mieux vaut le savoir avant d’acheter.
Espace SSD disponible. Les téléchargements de modèles vont de moins d’un gigaoctet à bien plus de dix, et une bibliothèque qui s’agrandit occupe vite de l’espace aux côtés de tes autres fichiers.
Comportement thermique en charge prolongée. Un modèle qui répond à une seule question et un laptop qui enchaîne plusieurs requêtes à la suite ne passent pas le même test. Le bruit des ventilateurs et la baisse de fréquence après plusieurs prompts en disent plus qu’une simple démo rapide.
Prise en charge de l’OS et des pilotes. Vérifie que la combinaison exacte de backend GPU et de système d’exploitation est bien prise en charge par Ollama ou LM Studio avant de partir du principe que ça fonctionnera.
Le nombre de TOPS du NPU affiché sur la boîte ne garantit aucun débit réel. C’est un argument marketing, pas un résultat mesuré avec le moteur que tu utiliseras. Un label aussi vague que « AI PC » ne remplace aucune des vérifications ci-dessus.
Ai-je besoin d’un GPU dédié pour faire tourner l’IA en local ?
Non. Un petit modèle peut tourner sur le CPU ou sur la partie graphique intégrée de nombreux laptops 16 Go, simplement avec plus de variations de vitesse que sur un laptop doté d’un GPU dédié. Commence par un modèle 2–4B avant de supposer que tu as absolument besoin d’une carte graphique dédiée.
Est-ce que 8 Go de RAM suffisent ?
Pas confortablement pour les modèles abordés ici. 16 Go constituent le vrai point de départ réaliste dès lors qu’il faut partager la mémoire entre le modèle, sa fenêtre de contexte, le moteur et le système d’exploitation.
Faire tourner un modèle en local, est-ce la même chose que l’entraîner ?
Non. Tout ce qui précède relève de l’inférence : on pose des questions à un modèle déjà entraîné. L’entraînement consiste à construire un modèle à partir de zéro et demande bien plus de matériel que n’importe quel laptop mentionné ici.
Une plus grande quantité de RAM garantit-elle des réponses plus rapides ?
Non. Plus de mémoire offre davantage de marge pour des modèles plus gros, un contexte plus long et plus d’applis ouvertes, mais la vitesse réelle dépend de la bande passante mémoire, du backend GPU et du modèle précis, pas de la seule quantité de mémoire.
Mes données restent-elles privées lorsqu’un modèle tourne en local ?
Oui, dans le sens où tes prompts restent sur ta machine au lieu d’être envoyés à un fournisseur cloud. Par défaut, Ollama se lie à ton propre laptop et n’envoie rien ailleurs, sauf si tu configures volontairement un accès cloud.
Tu as déjà un laptop 16 Go ? Installe Ollama ce soir et lance un petit modèle avant de dépenser le moindre euro dans du nouveau matériel. Tu achètes spécialement pour ça ? Appuie-toi sur la checklist ci-dessus, ainsi que sur les cinq laptops reconditionnés que nous venons de voir, pour établir une première comparaison plutôt que de te fier à une fiche marketing.
Chaque laptop sur refurbed est testé et évalué avant sa mise en ligne, donc la RAM et la configuration que tu achètes sont bien celles que tu reçois. Le prochain guide de cette série t’explique comment connecter ta première appli au modèle que tu viens d’essayer.
Inscrivez-vous à notre newsletter pour la première fois et économisez 15 € !
Ne manquez plus aucune offre.
Retrouvez les informations sur l'utilisation des données personnelles dans notre politique de confidentialité.
Confirmer l'inscription
Cliquez sur le lien dans notre e-mail de confirmation pour recevoir votre bon d'achat. Il sera valable pour tout achat supérieur à 200 €.