Infogérance scientifique et maintien en condition de plateformes HPC
- Date limite
- 6 novembre 2026 à 12 h
- Localisation
- Essonne (91)
- Durée
- 1 an ferme ; reconductions annuelles par levée d’option ; durée totale, reconductions comprises, plafonnée à 3 ans
- Budget
- Max: 2 800 000 €
Périmètre et organisation
L’accord-cadre couvre quatre volets activables indépendamment par les instituts concernés : exploitation, administration, tierce maintenance applicative (TMA) et accompagnement ISO 27001/HDS. Trois instituts du CEA-DRF peuvent émettre des commandes ou activer le marché : la Maison de la Simulation, l’Irfu et NeuroSpin. Le dimensionnement décrit à ce stade porte sur la Maison de la Simulation et le projet CAD-CEA/CAD-HPC ; les périmètres des autres instituts doivent être communiqués en COSTRA. Chaque institut fait l’objet d’une facturation et d’un suivi analytique séparés.
Le fonctionnement prévoit des phases Build et Run séquentielles ; après concertation en COSTRA, seule la phase Run peut être activée. La séparation des rôles est recherchée : les administrateurs ne sont pas en production, les responsabilités sur les nœuds de connexion et déploiements sont distinctes et la promotion préproduction vers production doit être contrôlée. L’exécution relève en principe d’une obligation de résultat ; certaines prestations de TMA peuvent relever d’une obligation de moyens renforcée.
Exploitation et assistance
Le volet exploitation prend en charge le support utilisateur N1/N2 et les opérations de production, selon le périmètre opérationnel défini au COPIL de démarrage de l’institut concerné. Le dimensionnement indicatif est d’environ 10 tickets N1 et 2 tickets N2 par mois, sur l’hypothèse d’une plateforme CAD-HPC associée à deux partenaires et de 80 utilisateurs au total la première année ; ce volume doit être révisé en cours de marché. Le niveau N3 est assuré par les architectes du CEA pour le dimensionnement indiqué.
Les tâches comprennent notamment :
- hotline et ticketing, création et fermeture des comptes et caractérisation des anomalies ;
- paramétrage des environnements utilisateurs, adaptations simples, comptabilité d’usage, sauvegardes et gestion des déploiements préproduction/production ;
- collecte des journaux et métrologie associée, MCO/MCS/MCD, inspection des CVE et élaboration de feuilles de route.
Ces prestations sont non localisées et peuvent être réalisées à distance.
Administration des infrastructures
Le volet administration couvre les opérations techniques sans relation directe avec les utilisateurs, les gestes en salle machine, la livraison et la performance de la solution matérielle et logicielle ainsi que la connectivité réseau. Il inclut la réception et l’installation des matériels, le rackage et le câblage, le déploiement et la qualification des machines physiques et virtuelles, des nœuds de calcul, des serveurs de connexion et du stockage. Les qualifications comprennent des tests de non-régression et des benchmarks.
Le dimensionnement de référence décrit :
- une infrastructure de préproduction de 6 nœuds de calcul, avec 1 152 cœurs dédiés au calcul, 2 GPU ou plus dédiés à l’IA, environ 400 To de stockage haute performance de type Vast et SLURM ;
- 12 serveurs d’infrastructure dédiés notamment à la virtualisation de postes (VDI), aux services et à l’administration ; le profil capacitaire indiqué comprend un processeur haute densité, 384 Go de RAM, environ 8 To de stockage local, un accélérateur graphique de 24 Go et des interfaces réseau 100 GbE ;
- un stockage 100 % flash NVMe d’environ 380 To bruts, raccordé en très haut débit (100 GbE) ;
- une paire de pare-feux à très haut débit et une paire de pare-feux applicatifs WAF pour une architecture de défense en profondeur ;
- une infrastructure de production en cours d’achat, destinée à être déployée sur site : environ 98 nœuds, 50 176 cœurs de calcul, 16 GPU ou plus dédiés à l’IA, SLURM, trois réseaux physiques distincts (inband, OOB et administration), interconnexion de stockage RoCE 100 Gb/s et volumétrie de 4 Po de type Vast.
Les environnements pris en charge comprennent les réseaux HPC, HDS, RoCE, VXLAN et FC, le stockage haute performance et les robotiques de stockage froid, ainsi que Proxmox, oVirt, Morpheus et KVM. Les tâches englobent aussi l’administration des VPN, pare-feux et routeurs, les audits de sécurité, le support expert et la qualification d’incidents complexes. La collecte de journaux doit couvrir exhaustivement toutes les machines de l’infrastructure, pas uniquement les nœuds de calcul.
Les interventions d’administration nécessitent une présence physique sur les sites. Le dimensionnement prévoit moins de 20 incidents par mois en moyenne, au maximum 6 astreintes de nuit et 2 astreintes de week-end par an, ainsi qu’un forfait annuel de 2 interventions, représentant 3 journées ou 9 demi-journées ; jusqu’à 6 journées hors forfait sont prévues. Le titulaire doit obtenir les habilitations requises avant toute intervention et gérer les autorisations et contrôles nécessaires pour l’admission de son matériel en salle machine.
Le modèle d’intervention impose des privilèges restreints : pas d’administration directe avec des droits étendus, tests des procédures en bac à sable puis exécution via un sas de séquestre. Pour les correctifs de sécurité, le titulaire informe des correctifs critiques sous 2 jours ouvrés et des correctifs standards sous 14 jours ; le RSSI associé au poste budgétaire valide leur application, que le titulaire réalise. Le périmètre comprend également une proposition de livraison, d’administration et d’exploitation d’un SOC.
Maintenance applicative et développements
La TMA porte sur du code open source ou développé en propre, notamment en C, Python et Golang, avec maîtrise des bibliothèques MPI/OpenMPI. Le périmètre de dimensionnement comprend des dépôts existants GitHub et 45 images Docker. Seuls les outils disposant d’une documentation fonctionnelle et d’un plan de test établi au moment de leur inclusion sont qualifiables au titre de la TMA.
La prestation couvre le support logiciel N3, la maintenance préventive et corrective du catalogue open source, les benchmarks applicatifs, le transfert de compétences et des formations de niveau débutant et intermédiaire. Elle distingue :
- TMA-A – maintenance logicielle : traitement des incidents logiciels de la pile open source et reversement à la communauté des correctifs développés dans un délai maximal de 3 mois ;
- TMA-B – développement logiciel : conception de fonctionnalités, intégration et déploiement continus, packaging et livraison systématique des tests de non-régression. Les développements spécifiques et nouvelles fonctionnalités ont vocation à être reversés à la communauté open source.
Les pipelines CI/CD doivent respecter la ségrégation des zones de sécurité. Les développements spécifiques sont déclenchés sur devis préalable. Les prestations de TMA sont non localisées.
Accompagnement ISO 27001 et HDS
Le volet 4 accompagne un institut pour les volets 1, 2 et 3 dans un mode certifié ISO 27001/HDS. La certification ISO 27001 constitue un préalable à la certification HDS ; les missions d’accompagnement ISO et HDS sont distinguées dans le BPU. Le cahier des charges décrit le périmètre HDS initial aux niveaux 1 à 5 et indique que le niveau 6 reste à définir ; il prévoit également que le titulaire puisse avoir la responsabilité HDS sur un périmètre de niveaux 1 à 6, selon une décision conjointe en COPIL. Les niveaux couvrent les sites physiques, l’infrastructure matérielle, la plateforme virtuelle, la plateforme applicative, l’administration et l’exploitation, puis la sauvegarde et la résilience.
Le BPU doit proposer des missions-types en unités d’œuvre pour l’obtention et le maintien des certifications. Les prestations prévues comprennent la mise en place et le pilotage d’un SMSI, un audit et une évaluation opérationnelle préalables, des Gap Assessments et feuilles de route, une analyse d’impact BIA, une analyse de risques EBIOS RM de haut niveau en complément du SWOT et du corpus SSI interne, un plan de continuité et de reprise d’activité, la déclaration d’applicabilité, le manuel de sécurité et les corpus documentaires ISO 27001 et HDS. L’accompagnement inclut les audits internes et externes nécessaires ; le titulaire peut, le cas échéant, être mandaté pour conduire la certification auprès du certificateur tiers. Les actions techniques et documentaires doivent rendre le périmètre HDS fonctionnel, auditable et conforme au niveau exigé.
Les prestations connexes couvrent les besoins ponctuels transverses situés hors du périmètre récurrent de MCO/MCS et de la TMA standard.
Réversibilité, qualité et sécurité
La réversibilité sortante se déroule en deux étapes successives : observation et consolidation de la documentation, puis transfert exhaustif des compétences, restitution des données et mise à jour finale de la documentation opérationnelle. Le titulaire produit et met à jour annuellement un PAQ autoporteur et un plan de réversibilité.
Les prestations en ZRR sont soumises au dispositif PPST et à la mention « Spécial France ». Le personnel doit disposer du niveau d’habilitation requis, avec des délais de plusieurs mois à anticiper ; la mention Spécial France implique des contraintes de nationalité pour les intervenants. Le titulaire doit respecter les bonnes pratiques recommandées par l’ANSSI (systèmes industriels de classe 3) et maintenir les dossiers de sécurité et d’exploitation. Un personnel habilité en base arrière doit pouvoir être mobilisé sous 15 jours.
Préparez votre dossier
Critères d'évaluation
Marchés similaires
Autres appels d'offres proches encore ouverts.
Infogérance de moyens de calcul et de licences scientifiques
CEA Grenoble
Maintenance de serveurs x86 et services associés
Informatique CDC
Infogérance et maintenance du système d’information
Commune de Cuincy
Posez vos questions sur le marché
Notre IA a lu l'intégralité du DCE et répond à toutes vos questions sur ce marché.