Catalogue initial
COMMUNAUTÉ FRANCOPHONE · IA LOCALE

Comprendre nos estimations.

Une source, un calcul et une mesure ne racontent pas la même chose.

01 · SOURCE

Ce que l’éditeur décrit

Architecture, paramètres, licence et contexte proviennent des fiches et fichiers de configuration officiels. Les liens et la date de consultation apparaissent sur chaque fiche.

02 · CALCUL

Ce que NVNC estime

La mémoire résulte d’hypothèses explicites. Elle aide à choisir des candidats ; elle ne mesure ni la vitesse ni la qualité.

03 · OBSERVATION

Ce qu’un membre déclare

Une mesure est liée au modèle, au matériel, au runner, à la quantification et au contexte. Un contrôle de cohérence ne prouve pas l’authenticité.

Le moteur mémoire · nvnc-memory-v0.1

Poids = paramètres × bits / 8 × 1,12
Cache KV = 2 × couches × têtes KV × dimension de tête × contexte × séquences × 2 octets
Mémoire estimée = (poids + cache KV + 0,75 Gio) × 1,15

Conversion en Gio : division par 2³⁰. La marge de 12 % sur les poids représente une approximation des métadonnées de quantification. Les 0,75 Gio de runtime et la marge de 15 % sont des hypothèses NVNC, à confronter aux mesures.

Profils simples : 4 Gio réservés au système sur Apple/CPU, 1 Gio sur GPU dédié. Cela ne mesure pas la mémoire libre réelle. Le calcul suppose un chargement complet, un cache KV FP16, sans offload CPU et sans autres tâches lourdes.

Le POC couvre seulement les modèles denses du catalogue. Il n’est pas un moteur universel pour MoE, vision, entraînement ou exécution distribuée. Les profils de quantification utilisent des largeurs moyennes approximatives. Les variantes mixtes K_S/K_M/K_L et leurs packages exacts peuvent différer ; leur disponibilité doit être vérifiée. Le moteur sélectionné ne modifie pas encore l’hypothèse commune de runtime.

Comparaisons et confiance

Les résultats sont déclaratifs. Les contrôles portent sur le schéma, les bornes, le contexte configuré, la cohérence débit/tokens/durée et les doublons. Les valeurs de mémoire supérieures au profil ou les débits supérieurs à 500 tok/s sont signalés, sans verdict de fraude.

Le format provisoire NVNC et les exports communautaires LLM-Benchmarker 2.2.0 sont pris en charge. Les tests natifs gardent leur phase, leur contexte et leur provenance ; la mémoire RSS reste distincte de la taille du modèle. Le rattachement au catalogue, la détection statistique et la modération administrative constituent les étapes suivantes.

Référence conceptuelle : Calculateur-Local-IA
LE MOTEUR DE COMPATIBILITÉ NVNC

Comment ça fonctionne ?

Votre besoin sélectionne des candidats. Votre matériel détermine la mémoire disponible. Le moteur et la quantification définissent le profil d’inférence.

Profil actuel : Ollama · Q4_K_M
4 096 tokens · 1 séquence(s) · 12 Gio disponibles selon le profil.

Une estimation explicite

Poids du modèle + cache KV FP16 + 0,75 Gio de runtime, puis 15 % de marge. Les poids utilisent une largeur moyenne approximative et une marge de 12 %.

Les variantes K_S, K_M et K_L peuvent mélanger plusieurs précisions. La taille exacte du package, les kernels et le backend doivent être vérifiés. Cette liste de profils ne garantit pas qu’un package existe pour chaque modèle.

La théorie et les mesures restent distinctes

La compatibilité mémoire ne prédit ni la vitesse ni la qualité. Les benchmarks déclarés précisent le contexte réel, sans être automatiquement certifiés.

Consulter la méthodologie complète

Comparer les modèles

Même quantification et même contexte. Aucune note de qualité supposée.

Critère
Paramètres
Contexte configuré
Mémoire estimée
Compatibilité
Licence
Usages