>_Reeboot
Xing4.0-29B-A4B : Le nouveau LLM MoE optimisé pour les agents et le code

Xing4.0-29B-A4B : Le nouveau LLM MoE optimisé pour les agents et le code

Découvrez Xing4.0-29B-A4B, un LLM MoE de 29B paramètres entraîné sur Ascend NPU, doté d'un contexte de 256K et taillé pour les agents et le code.

Développé par China Telecom Artificial Intelligence Technology Co., Ltd. et successeur de la série TeleChat, Xing4.0-29B-A4B s'impose comme un modèle de langage nouvelle génération taillé pour l'ingénierie logicielle et l'exécution de tâches complexes. Avec 29 milliards de paramètres au total dont seulement 4 milliards activés par jeton (architecture Mixture of Experts), ce modèle conjugue efficacité et puissance. Il prend en charge nativement une longueur de contexte de 256K, extensible à 512K, tout en reposant sur des choix architecturaux de pointe adaptés aux environnements de production exigeants.

Cet article propose une analyse technique approfondie de Xing4.0-29B-A4B, couvrant son architecture interne, son entraînement sur le matériel Ascend NPU, ses performances sur les benchmarks de pointe, ainsi que son intégration dans les flux de travail de développement modernes.

Architecture technique et innovations sous le capot

L'architecture de Xing4.0-29B-A4B repose sur la combinaison de plusieurs technologies de pointe en matière de réseaux de neurones et de traitement du langage naturel. L'objectif est d'offrir un équilibre optimal entre la capacité de raisonnement et la vitesse d'exécution, en particulier pour les agents logiciels et l'utilisation d'outils (tool calling).

La structure mHC + MLA + MTP

Le modèle intègre plusieurs innovations structurelles majeures :

  • Multi-head Latent Attention (MLA) : Permet de réduire drastiquement l'empreinte mémoire du cache KV (Key-Value) tout en maintenant une attention de haute qualité sur de très longues séquences.
  • mHC et MTP : Des mécanismes de planification multi-étapes et de prédiction multi-tokens qui renforcent la cohérence des chaînes de raisonnement complexes et stabilisent l'exécution sur des contextes étendus.

Paramétrage et dimensionnement du modèle

La conception de Xing4.0-29B-A4B repose sur une configuration MoE (Mixture of Experts) finement calibrée pour maximiser le débit tout en limitant la latence par jeton.

Spécification technique Valeur
Paramètres totaux 29 milliards (29B)
Paramètres actifs par token 4 milliards (4B)
Nombre de couches 40
Taille cachée (Hidden Size) 3584
Taille intermédiaire FFN dense 9216
Taille intermédiaire des experts 1024
Type d'attention MLA
Nombre d'experts routés 64
Experts actifs par jeton 4
Nombre d'experts partagés 1
Longueur de contexte native 256K (extensible à 512K)

Cette organisation permet d'obtenir la réactivité d'un modèle compact de 4 milliards de paramètres tout en bénéficiant de la richesse sémantique d'un modèle de 29 milliards de paramètres.

Entraînement et optimisation sur plateforme Ascend NPU

L'une des singularités majeures de Xing4.0-29B-A4B réside dans son infrastructure d'entraînement. Il s'agit du premier modèle de cette envergure entraîné intégralement sur la plateforme matérielle Ascend NPU, en utilisant le framework MindSpore et l'écosystème MindFormers de Huawei.

Co-optimisation matérielle et logicielle

Pour surmonter les défis inhérents à l'entraînement de modèles MoE à grande échelle sur de nouveaux accélérateurs, les équipes de China Telecom AI ont mené un travail de co-optimisation poussé :

  • Optimisation de la communication MoE à grain fin pour réduire les goulots d'étranglement inter-nœuds sur les clusters Ascend 910C.
  • Ré-exécution sélective (selective recomputation) afin d'optimiser l'utilisation de la mémoire vidéo (HBM).
  • Fusion automatique graphe-opérateur DVM pour accélérer l'exécution des calculs tensoriels.
  • Développement d'opérateurs fusionnés Ascend C dédiés aux composants mHC.

Grâce à ces efforts de bas niveau, le débit global d'entraînement a été amélioré d'environ 96% par rapport aux performances initiales standard, démontrant la maturité croissante des piles logicielles alternatives pour l'IA générative.

Évaluation comparative et benchmarks

Xing4.0-29B-A4B a été évalué sur une batterie exigeante de benchmarks évaluant le raisonnement mathématique, le respect des instructions, l'utilisation d'outils et l'ingénierie logicielle (SWE-bench, Terminal-Bench, etc.).

Benchmark Xing4.0-29B-A4B Gemma4-26B-A4B Qwen3.6-35B-A3B
IFBench 69.67 72.67 65.50
AIME2026 90.00 88.30 92.70
AA.LCR 61.00 66.00 62.00
Tau3-Bench 64.63 58.90 67.20
Claw-Eval 76.55 71.49 74.54
SWE-bench Verified 75.00 53.00 76.00
Terminal-Bench 2.1 57.50 30.00 51.50
SWE-bench Multilingual 66.00 51.00 67.20
DeepresearchBII 60.80 39.30 59.70

Analyse des performances sur les tâches d'ingénierie

Les résultats mettent en évidence les points forts du modèle dans les environnements de développement et les tâches d'agents autonomes :

  • SWE-bench Verified (75.00%) : Le modèle démontre une excellente capacité à résoudre des tickets de résolution de bugs sur des projets logiciels réels, rivalisant avec des modèles plus volumineux.
  • Terminal-Bench 2.1 (57.50%) : Une performance de premier plan pour interagir avec des environnements de ligne de commande et exécuter des tâches système complexes.
  • Claw-Eval et DeepresearchBII : Confirment l'aptitude du modèle à piloter des flux de recherche documentaire approfondie et de manipulation d'outils sous contexte étendu.

Écosystème open source et intégration pour le développement

Afin de faciliter l'adoption de Xing4.0-29B-A4B par la communauté des développeurs et les entreprises, le modèle bénéficie d'une compatibilité native avec les principaux frameworks d'inférence et de fine-tuning du marché.

Inférence et déploiement

Le modèle est compatible avec les moteurs de serving haut performance suivants :

  • vLLM : Pour un déploiement optimisé en production avec gestion avancée du cache KV.
  • SGLang : Pour maximiser le débit d'inférence structurée et l'exécution de programmes d'agents.
  • KTransformers : Pour une exécution locale ou sur des architectures matérielles spécifiques.

Adaptation aux frameworks d'agents

Le modèle intègre un alignement de format spécifique pour s'interfacer directement avec des frameworks d'agents de pointe tels que OpenCode, Claude Code, OpenClaw et Hermes. Cette adaptation garantit un support fluide des boucles de rétroaction, de l'appel d'outils (tool calls) et de l'analyse de grands dépôts de code source sans perte de contexte.

Paramètres recommandés selon les cas d'usage

Pour tirer le meilleur parti de Xing4.0-29B-A4B, il est conseillé d'ajuster les hyperparamètres d'échantillonnage en fonction de la nature de la tâche :

Scénario d'utilisation Température Top-p Pénalité de répétition
Raisonnement complexe / Tâches générales 1.0 0.95 1.05
Développement logiciel / Agents 0.8 0.95 1.05

Fine-tuning et adaptation aux domaines verticaux

Au-delà de ses capacités généralistes, Xing4.0-29B-A4B a été conçu pour permettre un fine-tuning économique et rapide sur des données métiers spécifiques. Grâce à sa compatibilité avec LLaMA-Factory et MindFormers, les équipes techniques peuvent réaliser des adaptations ciblées pour des cas d'usage professionnels stricts :

  • Audit de contrats juridiques nécessitant l'analyse de clauses complexes sur de longues fenêtres contextuelles.
  • Classification d'intentions et compréhension de tableaux financiers pour les services bancaires et assurantiels.
  • Bases de connaissances conversationnelles augmentées (RAG) exploitant des corpus documentaires denses et techniques.

Conclusion

Avec Xing4.0-29B-A4B, China Telecom livre une contribution majeure à l'écosystème des grands modèles de langage open source. En combinant une architecture MoE économe en paramètres actifs, un contexte natif étendu à 256K, des performances de premier plan sur les benchmarks de codage et d'agents, et une validation grandeur nature sur accélérateurs Ascend NPU, ce modèle s'adresse directement aux ingénieurs et architectes cherchant à déployer des systèmes d'IA autonomes robustes et performants.