Passer au contenu principal

Vinci MLE 1.0 · Modèle à poids ouverts

MLE 123B 1.0

Une spécialisation en ingénierie ML sur Devstral 2. Développée au Canada par SimpleDirect®, avec des poids BF16 fusionnés et trois quantifications GGUF pour votre propre environnement.

Vero devant un ordinateur vert pâle dans un atelier de recherche aux surfaces de pierre.
Illustration éditoriale conceptuelle, et non une exécution du modèle ou un résultat d’évaluation.

Le travail représenté dans l’entraînement

Il est entraîné à lire des fichiers et des résultats d’expérience, à chercher les problèmes et à expliquer la prochaine étape.

L’entraînement utilise 91 exemples de travail en plusieurs étapes couvrant 64 tâches. Il aborde huit domaines : qualité des données; compréhension des expériences; reprise d’entraînements en échec; gestion de la mémoire et des lots; vérification des scores; entraînement instable; préparation et exécution des modèles; et concordance des paramètres.

Modifier. Préserver. Demander des éléments.

Proposer une modification
Proposer une correction limitée lorsque les éléments disponibles la justifient.
Ne rien changer
Garder une configuration qui fonctionne lorsqu’une modification n’est pas justifiée.
Demander des éléments
Expliquer ce qui manque plutôt que deviner une réparation.

Cela décrit l’entraînement, pas des résultats prouvés sur de nouvelles tâches.

Ce que nous avons — et n’avons pas — testé

La couverture des évaluations varie selon le modèle. Les évaluations valides sur des tâches inédites d’ingénierie ML et sur le banc externe MLE-bench n’ont pas été réalisées pour la version 1.0. Nous prévoyons de les exiger avant de publier MLE 1.1.

Chaque fiche compare les capacités générales mesurées à celles de son propre modèle parent et présente les gains, les compromis et les évaluations manquantes. Ces résultats n’établissent pas les performances sur de nouvelles tâches d’ingénierie ML.

Dans l’évaluation d’utilisation d’outils BFCL, le score de 123B se situe dans la marge de rétention préenregistrée par rapport à son parent Devstral 2. Les résultats descriptifs de capacités générales incluent 63,64 % sur GPQA contre 57,07 % pour le parent, ainsi qu’une baisse de 4,8 points de pourcentage sur MATH-500 sur 500 questions. L’évaluation de code n’a pas été réalisée; aucun score n’est présenté ni déduit. Un test limité du format des appels d’outils en BF16 a réussi 12 cas sur 12, sans établir la fiabilité de l’utilisation d’outils.

Voir les résultats complets et les limites

L’exécuter dans votre environnement

Formats du modèle : poids BF16 fusionnés (250,05 Go), GGUF Q4_K_M (74,9 Go), Q5_K_M (88,3 Go) et Q8_0 (132,9 Go). L’exécution nécessite de la mémoire supplémentaire. Chaque GGUF a produit des réponses non vides à six invites neutres fixes; l’unique invite d’outil n’a pas produit d’appel analysable. Ces vérifications n’établissent pas une équivalence sur les tâches avec BF16.

123B utilise la licence Modified MIT de Mistral, contrairement aux modèles 8B et 30B sous Apache-2.0. Elle n’accorde aucun droit si le chiffre d’affaires mondial consolidé de votre entreprise ou de votre employeur a dépassé 20 millions de dollars américains au cours du mois précédent. Consultez la licence intégrale avant utilisation.

Ce sont des modèles de recherche téléchargeables, pas une application prête à l’emploi ni un assistant hébergé. Pour leur permettre de manipuler des fichiers ou de lancer des commandes, votre application doit fournir les outils, un espace contrôlé et les permissions. Examinez et testez les changements proposés.

8B offre un téléchargement plus léger et nécessite moins de mémoire. 30B a obtenu de meilleurs scores que 8B dans nos tests de code et d’utilisation d’outils. 123B repose sur Devstral 2 et utilise une autre licence. Ces résultats ne classent pas les modèles sur les tâches d’ingénierie ML.