Développé par China Telecom Artificial Intelligence Technology Co., Ltd. et successeur de la série TeleChat, Xing4.0-29B-A4B s'impose comme un modèle de langage nouvelle génération taillé pour l'ingénierie logicielle et l'exécution de tâches complexes. Avec 29 milliards de paramètres au total dont seulement 4 milliards activés par jeton (architecture Mixture of Experts), ce modèle conjugue efficacité et puissance. Il prend en charge nativement une longueur de contexte de 256K, extensible à 512K, tout en reposant sur des choix architecturaux de pointe adaptés aux environnements de production exigeants.
Cet article propose une analyse technique approfondie de Xing4.0-29B-A4B, couvrant son architecture interne, son entraînement sur le matériel Ascend NPU, ses performances sur les benchmarks de pointe, ainsi que son intégration dans les flux de travail de développement modernes.
Architecture technique et innovations sous le capot
L'architecture de Xing4.0-29B-A4B repose sur la combinaison de plusieurs technologies de pointe en matière de réseaux de neurones et de traitement du langage naturel. L'objectif est d'offrir un équilibre optimal entre la capacité de raisonnement et la vitesse d'exécution, en particulier pour les agents logiciels et l'utilisation d'outils (tool calling).
La structure mHC + MLA + MTP
Le modèle intègre plusieurs innovations structurelles majeures :
- Multi-head Latent Attention (MLA) : Permet de réduire drastiquement l'empreinte mémoire du cache KV (Key-Value) tout en maintenant une attention de haute qualité sur de très longues séquences.
- mHC et MTP : Des mécanismes de planification multi-étapes et de prédiction multi-tokens qui renforcent la cohérence des chaînes de raisonnement complexes et stabilisent l'exécution sur des contextes étendus.
Paramétrage et dimensionnement du modèle
La conception de Xing4.0-29B-A4B repose sur une configuration MoE (Mixture of Experts) finement calibrée pour maximiser le débit tout en limitant la latence par jeton.
| Spécification technique | Valeur |
|---|---|
| Paramètres totaux | 29 milliards (29B) |
| Paramètres actifs par token | 4 milliards (4B) |
| Nombre de couches | 40 |
| Taille cachée (Hidden Size) | 3584 |
| Taille intermédiaire FFN dense | 9216 |
| Taille intermédiaire des experts | 1024 |
| Type d'attention | MLA |
| Nombre d'experts routés | 64 |
| Experts actifs par jeton | 4 |
| Nombre d'experts partagés | 1 |
| Longueur de contexte native | 256K (extensible à 512K) |
Cette organisation permet d'obtenir la réactivité d'un modèle compact de 4 milliards de paramètres tout en bénéficiant de la richesse sémantique d'un modèle de 29 milliards de paramètres.
Entraînement et optimisation sur plateforme Ascend NPU
L'une des singularités majeures de Xing4.0-29B-A4B réside dans son infrastructure d'entraînement. Il s'agit du premier modèle de cette envergure entraîné intégralement sur la plateforme matérielle Ascend NPU, en utilisant le framework MindSpore et l'écosystème MindFormers de Huawei.
Co-optimisation matérielle et logicielle
Pour surmonter les défis inhérents à l'entraînement de modèles MoE à grande échelle sur de nouveaux accélérateurs, les équipes de China Telecom AI ont mené un travail de co-optimisation poussé :
- Optimisation de la communication MoE à grain fin pour réduire les goulots d'étranglement inter-nœuds sur les clusters Ascend 910C.
- Ré-exécution sélective (selective recomputation) afin d'optimiser l'utilisation de la mémoire vidéo (HBM).
- Fusion automatique graphe-opérateur DVM pour accélérer l'exécution des calculs tensoriels.
- Développement d'opérateurs fusionnés Ascend C dédiés aux composants mHC.
Grâce à ces efforts de bas niveau, le débit global d'entraînement a été amélioré d'environ 96% par rapport aux performances initiales standard, démontrant la maturité croissante des piles logicielles alternatives pour l'IA générative.
Évaluation comparative et benchmarks
Xing4.0-29B-A4B a été évalué sur une batterie exigeante de benchmarks évaluant le raisonnement mathématique, le respect des instructions, l'utilisation d'outils et l'ingénierie logicielle (SWE-bench, Terminal-Bench, etc.).
| Benchmark | Xing4.0-29B-A4B | Gemma4-26B-A4B | Qwen3.6-35B-A3B |
|---|---|---|---|
| IFBench | 69.67 | 72.67 | 65.50 |
| AIME2026 | 90.00 | 88.30 | 92.70 |
| AA.LCR | 61.00 | 66.00 | 62.00 |
| Tau3-Bench | 64.63 | 58.90 | 67.20 |
| Claw-Eval | 76.55 | 71.49 | 74.54 |
| SWE-bench Verified | 75.00 | 53.00 | 76.00 |
| Terminal-Bench 2.1 | 57.50 | 30.00 | 51.50 |
| SWE-bench Multilingual | 66.00 | 51.00 | 67.20 |
| DeepresearchBII | 60.80 | 39.30 | 59.70 |
Analyse des performances sur les tâches d'ingénierie
Les résultats mettent en évidence les points forts du modèle dans les environnements de développement et les tâches d'agents autonomes :
- SWE-bench Verified (75.00%) : Le modèle démontre une excellente capacité à résoudre des tickets de résolution de bugs sur des projets logiciels réels, rivalisant avec des modèles plus volumineux.
- Terminal-Bench 2.1 (57.50%) : Une performance de premier plan pour interagir avec des environnements de ligne de commande et exécuter des tâches système complexes.
- Claw-Eval et DeepresearchBII : Confirment l'aptitude du modèle à piloter des flux de recherche documentaire approfondie et de manipulation d'outils sous contexte étendu.
Écosystème open source et intégration pour le développement
Afin de faciliter l'adoption de Xing4.0-29B-A4B par la communauté des développeurs et les entreprises, le modèle bénéficie d'une compatibilité native avec les principaux frameworks d'inférence et de fine-tuning du marché.
Inférence et déploiement
Le modèle est compatible avec les moteurs de serving haut performance suivants :
- vLLM : Pour un déploiement optimisé en production avec gestion avancée du cache KV.
- SGLang : Pour maximiser le débit d'inférence structurée et l'exécution de programmes d'agents.
- KTransformers : Pour une exécution locale ou sur des architectures matérielles spécifiques.
Adaptation aux frameworks d'agents
Le modèle intègre un alignement de format spécifique pour s'interfacer directement avec des frameworks d'agents de pointe tels que OpenCode, Claude Code, OpenClaw et Hermes. Cette adaptation garantit un support fluide des boucles de rétroaction, de l'appel d'outils (tool calls) et de l'analyse de grands dépôts de code source sans perte de contexte.
Paramètres recommandés selon les cas d'usage
Pour tirer le meilleur parti de Xing4.0-29B-A4B, il est conseillé d'ajuster les hyperparamètres d'échantillonnage en fonction de la nature de la tâche :
| Scénario d'utilisation | Température | Top-p | Pénalité de répétition |
|---|---|---|---|
| Raisonnement complexe / Tâches générales | 1.0 | 0.95 | 1.05 |
| Développement logiciel / Agents | 0.8 | 0.95 | 1.05 |
Fine-tuning et adaptation aux domaines verticaux
Au-delà de ses capacités généralistes, Xing4.0-29B-A4B a été conçu pour permettre un fine-tuning économique et rapide sur des données métiers spécifiques. Grâce à sa compatibilité avec LLaMA-Factory et MindFormers, les équipes techniques peuvent réaliser des adaptations ciblées pour des cas d'usage professionnels stricts :
- Audit de contrats juridiques nécessitant l'analyse de clauses complexes sur de longues fenêtres contextuelles.
- Classification d'intentions et compréhension de tableaux financiers pour les services bancaires et assurantiels.
- Bases de connaissances conversationnelles augmentées (RAG) exploitant des corpus documentaires denses et techniques.
Conclusion
Avec Xing4.0-29B-A4B, China Telecom livre une contribution majeure à l'écosystème des grands modèles de langage open source. En combinant une architecture MoE économe en paramètres actifs, un contexte natif étendu à 256K, des performances de premier plan sur les benchmarks de codage et d'agents, et une validation grandeur nature sur accélérateurs Ascend NPU, ce modèle s'adresse directement aux ingénieurs et architectes cherchant à déployer des systèmes d'IA autonomes robustes et performants.
