Articles acceptés
D3CS : Architecture data-centric security décentralisée et dynamique (WiP)
Avec le développement croissant des technologies de l’information, la sécurisation de l’accès aux données est devenue une préoccupation majeure. Pour répondre à cette problématique, le Data-Centric Security (DCS) vise à intégrer un mécanisme de contrôle d’accès au sein des données elles-mêmes, ajoutant ainsi une couche de sécurité supplémentaire. Cependant, la prise en compte de la décentralisation et de la dynamicité dans les architectures implémentant le DCS demeure un défi ouvert. Cet article propose une revue structurée et met en évidence les limites des approches existantes. Nous proposons par conséquent une nouvelle architecture ouvrant la voie à l’implémentation d’un DCS décentralisé et dynamique. L’architecture proposée s’appuie sur des mécanismes de contrôle d’accès, des schémas de chiffrement à base d’attributs et des mécanismes fondés sur la confiance, qu’elle enrichit par des fonctionnalités d’authentification, de révocation d’attributs, de prise en compte du contexte et de délégation décentralisée des droits d’accès pour les sujets, formalisé à travers six algorithmes. Les résultats mettent en évidence plusieurs points forts de l’architecture D3CS proposée, ainsi que des perspectives à traiter dans des travaux futurs.
Etienne Lemonnier
(Académie Militaire de Saint-Cyr Coëtquidan, CReC Saint-Cyr,Université Bretagne Sud, IRISA, France)
;
Jamal El Hachem
(Université Bretagne Sud, IRISA, France)
;
Lionel Touseau
(Académie Militaire de Saint-Cyr Coëtquidan, CReC Saint-Cyr,Université Bretagne Sud, IRISA, France)
;
Jérémy Buisson
(École de l'air et de l'espace, CRéA, France)
;
Nicolas Belloir
(Académie Militaire de Saint-Cyr Coëtquidan, CReC Saint-Cyr,Université Bretagne Sud, IRISA, France)
;
Jean-François Wiorek
(Thales Group, France)
Langue : Anglais (sous-titré en français)
Travaux en cours (WiP)
De la réalité à la simulation : une méthodologie pour dériver des scénarios de troubles informationnels à partir de cas réels
Cet article propose une méthodologie structurée pour transformer des cas réels de troubles informationnels en scénarios de simulation formalisés. Si les cadres existants fournissent des taxonomies de tactiques et d'interventions, ils n'offrent pas de procédures systématiques pour dériver des modèles exécutables à partir de situations empiriques. Nous introduisons un pipeline en dix étapes qui extrait les acteurs, les narratifs, les actifs, les opinions et les tensions systémiques à partir de cas réels. La méthodologie est illustrée par une étude de cas fondée sur les dynamiques informationnelles électorales en Roumanie en novembre 2024. Le scénario obtenu montre comment des observations qualitatives peuvent être traduites en modèles structurés, prêts pour la simulation. Pour valider cette approche, nous avons implémenté ce scénario dans Critical Masses, un logiciel de simulation de la lutte contre les troubles informationnels, fondé sur Infodemiconium, un cadre de modélisation des troubles informationnels.
Laurent Bobelin
(INSA Centre Val de Loire, France)
Langue : Anglais (sous-titré en français)
Mesurer la valeur opérationnelle de la micro-segmentation fondée sur l’identité dans les environnements hybrides : une comparaison reproductible avec la segmentation par ACL
L’architecture Zero Trust (ZTA) promeut des décisions de contrôle d’accès fondées sur l’identité, le contexte et le moindre privilège plutôt que sur une confiance implicite liée à la localisation réseau. Dans les environnements hybrides combinant ressources sur site et ressources cloud, la micro-segmentation fondée sur l’identité est souvent présentée comme un mécanisme permettant de réduire le mouvement latéral, la surface atteignable et le rayon d’impact post-compromission. Cependant, les équipes de sécurité manquent encore de comparaisons contrôlées et reproductibles qui quantifient ce qu’un contrôle au niveau applicatif, tenant compte de l’identité, apporte par rapport à la segmentation traditionnelle par ACL au niveau réseau (L3/L4), et à quel coût opérationnel. Cet article propose un cadre comparatif reproductible et présente des résultats expérimentaux préliminaires pour un système d’information hybride simplifié. Nous comparons deux variantes de protection implémentées : (i) une segmentation périmétrique traditionnelle fondée sur des ACL réseau L3/L4 statiques appliquées par un pare-feu (pfSense), et (ii) une micro-segmentation fondée sur l’identité, appliquée au niveau de chaque requête par un point d’application des politiques NGINX couplé à un moteur de décision Open Policy Agent (OPA), au TLS mutuel et à des JSON Web Tokens de courte durée de vie. Une troisième variante, optionnelle, envisage des identités de charges de travail attestées cryptographiquement à l’aide de SPIFFE/SPIRE, conformément aux recommandations relatives au niveau identité pour la ZTA cloud-native. Le cadre isole la couche de contrôle des flux tout en conservant, d’une variante à l’autre, la même topologie, les mêmes composants applicatifs, les mêmes flux de travail légitimes et les mêmes scénarios offensifs. Nous rendons opérationnelles des métriques de sécurité, de complexité et de performance, et exécutons quatre scénarios offensifs (accès non authentifié, pivot via la base de données, rebond côté cloud et abus d’identifiants au niveau applicatif par injection SQL et force brute) dans des conditions identiques. Les résultats préliminaires montrent que la référence fondée sur les ACL réseau bloque le pivot au niveau réseau mais laisse réussir une attaque par force brute sur les identifiants au niveau applicatif, tandis que le contrôle tenant compte de l’identité bloque les quatre scénarios offensifs pour un surcoût de latence médian négligeable (+4 ms, +0,07 %). L’objectif n’est pas de prétendre à un déploiement Zero Trust complet, mais de fournir une base structurée et reproductible pour mesurer quand un contrôle tenant compte de l’identité apporte une valeur de confinement au-delà d’un zonage réseau statique, et quels coûts de gestion des politiques et d’exécution il introduit.
Yulliwas Ameur
(Efrei Research Lab, Efrei, Université Paris-Panthéon-Assas;Cédric, Conservatoire national des arts et métiers (Cnam), France)
;
Daniel Tanier
(CEDRIC Lab, Conservatoire National des Arts et M´etiers(CNAM), 292 rue Saint-Martin, 75141 Paris, France, France)
;
Soumya Banerjee
(Cédric, Conservatoire national des arts et métiers (Cnam), France)
Langue : Anglais (sous-titré en français)
Travaux en cours (WiP)
CIGMA : un graphe d'inventaire cryptographique fondé sur les preuves pour une priorisation reproductible de la migration post-quantique
La migration vers la cryptographie post-quantique (PQC) commence par la découverte, mais un inventaire à plat ne peut pas relier les certificats, bibliothèques, pipelines ou équipements observés aux services qui en dépendent. CIGMA résout de manière déterministe des observations hétérogènes en un graphe de dépendances typé, avec une provenance adossée à un localisateur pour chaque assertion acceptée. Son ontologie fermée, son contrôle qualité et ses chemins sur liste blanche forment un contrat structurel exécutable. L'impact, la faisabilité de la migration et la confiance dans les preuves restent séparés ; des niveaux de politique, des fronts de Pareto et des règles de départage stables définissent l'ordre principal, un comparateur pondéré étant conservé comme référence. CIGMA-Lab fournit 46 observations d'entités et 34 observations de relations issues de six familles de sources ; un oracle de 23 entités et 34 relations est tenu à l'écart dans une arborescence distincte réservée à l'évaluateur. CIGMA atteint 1,0 sur les quatre métriques F1 de reconstruction et un NDCG@10 ≈ 0,90 par rapport à des priorités définies par les auteurs. Nous effectuons également 384 exécutions appariées de méthodes sur 128 scénarios de suppression, un comparateur fondé sur une bibliothèque externe TFIDF-Cosine et une sonde synthétique de passage à l'échelle. Dans une cohorte scellée séparément, à entrée fixe, de 30 appels à gpt-5.6-luna, la validation déterministe atteint une précision moyenne de 1,0000, n'accepte aucun triplet faux selon l'oracle dans ces appels et fait passer le F1 moyen des candidats de 0,9361 à 0,9554. Ces résultats établissent un comportement reproductible sur un banc d'essai contrôlé unique, et non une exactitude en contexte organisationnel ni un accord d'experts. L'artefact de soumission comprend l'oracle séparé, des références et des ablations exécutables, le rejeu hors ligne du modèle et un protocole en deux phases permettant de sceller les prédictions pour de futures réplications indépendantes avant tout accès à l'oracle.
Yulliwas Ameur
(Efrei Research Lab, Efrei, Université Paris-Panthéon-Assas;Cédric, Conservatoire national des arts et métiers (Cnam), France)
;
Insaf Imene Lasledj
(Efrei Research Lab, Efrei, Université Paris-Panthéon-Assas, France)
;
Soumya Banerjee
(Cédric, Conservatoire national des arts et métiers (Cnam), France)
Langue : Anglais (sous-titré en français)
SAINTS : Modélisation formelle d’une infrastructure d’identités synthétiques autonomes à topologie distribuée
Les modèles d’inférence locale réduisent et déplacent structurellement le goulot d’étranglement de supervision humaine qui a historiquement contraint les infrastructures d’influence. Ce travail formalise SAINTS (Synthetic Autonomous Identity Network for Targeting with Saturation ), une classe d’infrastructure où chaque persona s’exécute sur un nœud physiquement isolé, le modèle étant fine-tuné au niveau des poids sur un profil comportemental cible et non sur une mission. L’autonomie désigne ici le maintien passif des identités, non une campagne active non supervisée. SAINTS est présenté comme un modèle de menace formel, et non comme un système implémenté ou validé : la contribution est un modèle assez précis pour que ses surfaces de rupture deviennent analysables. Quatre propriétés architecturales sont caractérisées (non-corrélation, cohérence comportementale incarnée, chaînes d’action opaques, saturation), l’asymétrie de coût entre déploiement et investigation est formalisée, et cinq surfaces de détection que l’architecture ne peut pas absorber sont identifiées. L’affirmation centrale est une inégalité structurelle : sous les hypothèses posées, le coût d’investigation croît super-linéairement avec la taille du réseau tandis que le coût de déploiement croît linéairement, d’où l’existence possible d’un seuil 𝑘* (conditionnel à la fonction de succès et au budget du défenseur) au-delà duquel l’investigation deviendrait, dans ce modèle, économiquement irrationnelle. Les estimations chiffrées sont illustratives, non normatives, et requièrent une calibration empirique. La patience, attente d’une défaillance de l’opérateur humain probable à horizon long, apparaît comme un vecteur défensif principal dont le coût croît symétriquement à celui du déploiement attaquant.
Charles Mordelet
(Chercheur indépendant, France)
Langue : Anglais (sous-titré en français)
Travaux en cours (WiP)
Du scénario d'attaque à l'amélioration mesurable de la détection : un cadre ATT&CK / D3FEND fondé sur les connaissances pour le purple teaming instrumenté
Les organisations mènent des exercices de purple team, identifient des lacunes, corrigent quelques règles et annoncent un succès — mais, sans cadre de mesure formel, elles ne peuvent pas quantifier dans quelle mesure la détection s'est améliorée ni pourquoi certaines techniques n'ont pas été détectées. Les modèles de prédiction d'attaques obtiennent de bons scores F1 mais ne produisent aucun résultat défensif. Les graphes de connaissances CTI associent les menaces à des contre-mesures sans jamais vérifier si ces contre-mesures se déclenchent sur de la télémétrie réelle. L'écart entre l'émulation d'une attaque et la démonstration d'une amélioration de la détection reste entier. Nous comblons cet écart avec un cadre de purple teaming instrumenté piloté par un graphe de connaissances. Un graphe de connaissances (KG) bidirectionnel encode la chaîne complète, de la technique ATT&CK à la source de données, à la stratégie de détection, à la règle analytique, à la source de journaux et au capteur — et pas seulement le versant attaque. Chaque étape d'émulation est annotée avec la télémétrie attendue et des critères de succès, de sorte que, lorsque la détection échoue, un parcours à rebours du graphe identifie précisément pourquoi : une source de journaux manquante, une règle absente ou une configuration inadéquate. Après une remédiation ciblée, le même scénario est rejoué et l'amélioration est quantifiée au moyen d'indicateurs clés de performance (KPI) opérationnels ancrés sur la couverture de détection (𝐶). Nous évaluons le cadre sur quatre profils de menace — espionnage étatique (APT29), cybercriminalité financière (FIN6), opérations destructrices étatiques (Sandworm) et rançongiciel de type big-game hunting (Wizard Spider) — tous issus de la bibliothèque publique d'émulation d'adversaires du CTID [1]. Le critère d'évaluation principal est la couverture de détection (𝐶), évaluée à l'aide d'une règle de décision à seuil fixe (Δ𝐶3 > 0.10 dans ≥3/4 scénarios). L'échelle de maturité de détection en quatre étapes fait passer la couverture stricte de 𝐶0 = 23.1% (SIEM dans sa configuration par défaut) à 𝐶3 = 71.6% (avec les règles générées par le KG), l'étape d'ingénierie de règles guidée par le KG contribuant à elle seule en moyenne Δ𝐶3 = +30.3 points de pourcentage. La règle de décision est satisfaite dans les quatre scénarios.
Tristan Madani
(CEDRIC Lab, Conservatoire National des Arts et M´etiers(CNAM), 292 rue Saint-Martin, 75141 Paris, France, France)
;
Yulliwas Ameur
(Efrei Research Lab, Efrei, Université Paris-Panthéon-Assas;Cédric, Conservatoire national des arts et métiers (Cnam), France)
;
Samia Bouzefrane
(CEDRIC Lab, Conservatoire National des Arts et M´etiers(CNAM), 292 rue Saint-Martin, 75141 Paris, France, France)
Langue : Anglais (sous-titré en français)
Du SBOM à l'audit : orchestration temporelle des preuves de vulnérabilité pour le signalement NIS2 et CRA
Le signalement en matière de cyber-résilience européenne exige des équipes de sécurité des produits qu'elles établissent des positions de signalement défendables alors que les preuves de vulnérabilité restent incomplètes, distribuées et potentiellement contradictoires. Cet article présente un artefact d'orchestration temporelle des preuves de vulnérabilité qui normalise la composition logicielle, le statut d'affectation déclaré par les fournisseurs, le renseignement sur l'exploitation, l'applicabilité locale, le contexte de déploiement et les enregistrements de décision en assertions liées à leurs sources. Le modèle implémenté sépare la recommandation étayée par les preuves, la position vis-à-vis des échéances et l'EvidencePack/instantané d'audit versionné, tout en représentant explicitement l'incertitude, la confiance dans l'identification et les conflits actifs. L'évaluation combine quatre familles de scénarios contrôlés et des contrôles appariés, une référence PSIRT manuelle assistée de 28 événements, une analyse de sensibilité contrôlée, des tests de mutation, une évaluation du passage à l'échelle et un rejeu historique public borné. Sur les quatre scénarios principaux, le flux de travail orchestré a renseigné l'intégralité du schéma natif EvidencePack à 34 champs (1,000 contre 0,824), bien que les deux flux de travail aient atteint une couverture complète des champs communs et une traçabilité complète. Tous deux ont détecté l'unique conflit injecté, tandis que la précision de détection des conflits était de 1,000 pour le flux orchestré et de 0,200 pour la référence manuelle. La conformité à l'oracle d'états était de 1,000 contre 0,258, et la génération native d'EvidencePack de 1,000 contre 0,000, tandis qu'un contrôle complémentaire a confirmé que le flux manuel pouvait produire un ensemble d'enregistrements structurés équivalent. Les résultats confirment l'intérêt de l'orchestration temporelle pour améliorer la continuité des décisions et la reconstructibilité de l'audit dans le cadre de l'étude contrôlée, sans considérer les états obtenus comme des déterminations juridiques ni comme la preuve d'une supériorité universelle en matière de PSIRT.
Richard Dosumu
(Independent Researcher, United Kingdom)
Langue : Anglais (sous-titré en français)
Traduction binaire pour l'analyse de sécurité multi-architecture : une évaluation empirique à grande échelle de l'aboutissement du pipeline de traduction
Les équipes modernes de sécurité produit doivent évaluer les vulnérabilités sur un éventail croissant d'architectures de processeurs — ARM, RISC-V, IBM s390x, PowerPC — alors que la plupart des chaînes d'outils d'analyse binaire ciblent exclusivement x86-64. La traduction binaire offre une voie fondée sur des principes : remonter un binaire d'architecture étrangère vers la représentation intermédiaire LLVM, le compiler en x86-64 et appliquer l'infrastructure d'analyse existante sans modification. Un prérequis de cette approche est que les traducteurs produisent, à grande échelle, une sortie x86-64 valide et analysable. Nous présentons la première évaluation empirique à grande échelle de ce prérequis, en mesurant trois traducteurs open source modernes (RetDec, Anvill, rev.ng) et le système classique UQBT sur un corpus de 39 364 binaires ELF de production issus de dix versions de distributions Linux couvrant cinq architectures. Nos résultats révèlent une complémentarité architecturale décisive : RetDec atteint 79,1 % d'aboutissement de la traduction sur ARM64 tout en échouant sur RISC-V (12,3 %) et s390x (3,2 %) ; Anvill atteint 94,1 % sur RISC-V et 68,1 % sur s390x tout en étant largement inefficace sur ARM ; rev.ng offre la couverture la plus large (85–100 % sur ARM, 58 % sur s390x) au prix d'une pénalité de vitesse de 36×. Un portefeuille de deux outils (RetDec + Anvill) atteint 55,9 % au global et 70,5 % sur les architectures prises en charge, à des vitesses compatibles avec les délais de 24 heures des PSIRT imposés par NIS2/CRA ; l'ajout de rev.ng porte la couverture à environ 83–100 % sur les architectures prises en charge (estimation ponctuelle 93 %, IC à 95 % ±9,8 % par architecture, obtenu à partir d'un échantillon stratifié de n = 100). Une lacune complète sur PowerPC64 (0 %, tous outils confondus, 8 134 binaires) constitue un risque significatif pour les organisations exploitant une infrastructure IBM POWER. Les chiffres de couverture sont des bornes supérieures de l'utilité pour l'analyse de sécurité, en attendant des expériences de préservation des vulnérabilités sur les binaires traduits. Toutes les données sont publiquement disponibles sur Zenodo [1].
Jonathan Brossard
(MOABI Solutions, France)
Langue : Anglais (sous-titré en français)
Travaux en cours (WiP)
Renforcer la résilience des organisations peu matures face aux crises cyber grâce à l'entraînement immersif
Le protocole d'exercice RéSISTeCC est le fruit de trois années de travail interdisciplinaire couvrant la réponse à incident, la gestion de crise et l'ergonomie cognitive. Le projet RéSISTeCC signifie résilience par la simulation immersive stratégique et technique de crises cyber et a été financé par NextGenerationEU et France 2030 dans le cadre de l'appel à projets DEFFINUM. La dernière version de ce protocole propose une session d'entraînement à la crise cyber de sept heures conçue pour des organisations disposant d'une expérience limitée en cybersécurité. Son objectif est d'évaluer et de tester les processus de gestion de crise selon les perspectives à la fois technique et stratégique. Le protocole d'exercice implique une cellule stratégique et une cellule technique chargées de la gestion de la crise cyber, qui doivent collaborer et coordonner leurs actions simultanément. Seule la cellule technique est immergée dans un cyber range simulant un système d'information générique « LOREM ». Les deux cellules reçoivent des appels téléphoniques des animateurs et peuvent s'appeler ou se rendre visite. Traditionnellement, les exercices de gestion de crise cyber exigent une attention particulière lors de leur conception en raison de leur complexité sociotechnique. De même, leur pilotage et leur exécution reposent généralement sur un chronogramme d'événements prédéfini et figé, élaboré à l'avance. Dans le cas du protocole d'exercice RéSISTeCC, il a été possible de mettre en place une approche de pilotage dynamique de l'exercice qui adapte l'objectif pédagogique et les stimuli associés aux réponses et actions effectives des participants tout au long de l'exercice. Cet article présente une évaluation des activités menées lors des tests de RéSISTeCC, en décrivant les besoins en topologies de cyber range pour les services informatiques et la manière dont ces infrastructures doivent être peuplées de données selon le type d'organisations cibles : collectivités territoriales, petites et moyennes entreprises (PME), établissements de santé et établissements d'hébergement de longue durée, services d'incendie et de secours. Nous détaillons la conception et le déroulement de l'exercice, de ses premières étapes jusqu'à la gestion de crise, ainsi que l'importance de ces différentes phases pour la conscience de la situation, une fois l'attaque survenue. Nous expliquons les mesures en temps réel de la performance des participants et la manière dont elles sont utilisées pour alimenter le réservoir de stimuli des animateurs en fonction des objectifs pédagogiques et de l'état réel de l'infrastructure informatique au regard de la cyberattaque et des actions des personnes impliquées. Ces retours d'expérience reposent sur la conception, la mise en œuvre et le test de 28 exercices impliquant des équipes de réponse à la crise comptant de 2 à 30 personnes.
Marc Parenthoën
(XLim, UMR CNRS 7252, ENSAR, Université de Poitiers, France)
;
Jose Manuel Castillo
(CeRCA CNRS UMR 7295, Université de Poitiers, Perseus UR7312, Université de Lorraine, France)
;
Nicolas Louveton
(CeRCA CNRS UMR 7295, Université de Poitiers, France)
;
Alexandre Wets
(DIATEAM, France)
;
Corentin Tuot
(DIATEAM, France)
;
Clément Judek
(Crisalyde, France)
;
Hadrien Bourgogne
(Crisalyde, France)
;
Selim Miled
(Crisalyde, France)
Langue : Anglais (sous-titré en français)
Travaux en cours (WiP)
SCEN&R : vers un standard ouvert pour des scénarios réalistes d'émulation d'adversaire
L'émulation d'adversaire est de plus en plus utilisée pour valider l'ingénierie de détection, former les analystes SOC/CERT et évaluer la préparation défensive face à des comportements d'attaque réalistes. Cependant, les artefacts d'émulation réutilisables restent difficiles à produire et à partager : les tests au niveau des techniques sont souvent trop isolés pour rendre compte de la progression de l'attaquant, tandis que les scénarios complets sont fréquemment liés à des cyber ranges, des agents ou des moteurs d'exécution spécifiques. Cet article présente SCEN&R, une spécification ouverte, indépendante des fournisseurs et fondée sur YAML, permettant de décrire des scénarios réalistes d'émulation d'adversaire indépendamment de leur backend d'exécution. SCEN&R modélise un scénario d'émulation sous la forme d'étapes liées à des sessions, portant sur des procédures réutilisables, des variables explicites, une infrastructure attaquante déclarée et un graphe d'exécution orienté acyclique avec des conditions évaluées à l'exécution. Ce format s'intègre à MITRE ATT&CK et à Atomic Red Team afin de réutiliser des procédures standardisées au niveau des techniques tout en les étendant en scénarios cohérents au niveau de la campagne. Nous décrivons la conception de SCEN&R, sa sémantique d'exécution, ainsi qu'une implémentation de référence en Python qui valide les scénarios, résout les flux de données, évalue les branches conditionnelles et prend en charge leur exécution. Notre objectif est de fournir un langage de scénarios pratique, accompagné d'une implémentation de référence, pour une émulation d'adversaire portable à travers les cyber ranges, les exercices purple team, la validation de la détection et la recherche en sécurité.
Frédéric Guihery
(Almond R&D, France)
;
Damien Crémilleux
(Almond R&D, France)
;
Théo Vieugué
(Almond R&D, France)
;
Thibault Lefrançois
(Almond R&D, France)
Langue : Anglais (sous-titré en français)
Travaux en cours (WiP)
Un GNN en deux phases pour la détection d'APT sur la télémétrie EDR de production
La détection EDR fondée sur des règles peine face aux APT, dont le signal réside dans les relations causales entre les entités du système plutôt que dans des événements individuels. Les GNN sur graphes de provenance répondent à ce problème, mais les systèmes existants sont entraînés sur des traces d'appels système de niveau recherche (par ex. DARPA TC) et n'ont pas été validés sous les contraintes d'un EDR de production, qui instrumente un sous-ensemble plus restreint des interactions du système. Nous présentons un pipeline GNN en deux phases adapté à ces contraintes : la Phase 1 pré-entraîne un GAT à trois couches sur des graphes de provenance bénins issus d'un capteur Elastic Endpoint (≈2M nœuds) à l'aide d'un auto-encodeur de graphe masqué ; la Phase 2 affine une tête de classification légère sur des étiquettes faibles dérivées des rapports d'opération MITRE Caldera, l'encodeur étant gelé. Sur un jeu de données collecté par nos soins, composé de quatre profils associés à ATT&CK (reconnaissance furtive, exfiltration, persistance cron et systemd) et d'un cinquième profil tenu à l'écart, l'entraînement sur la persistance et l'exfiltration permet la détection d'un profil de reconnaissance inédit et peu générateur d'alertes avec une AUPRC de 0,635 ; l'évaluation intra-profil atteint 0,648–0,973, contre une précision des alertes de 4,1 % et un rappel de 11–25 % sur les profils évalués pour le moteur de règles d'Elastic Security sur une télémétrie identique.
Mario López Quesada
(Aalto University, Norwegian University of Science andTechnology, Huawei, Finland)
;
Vijayanand Nayani
(Huawei, Finland)
;
Sule Yildirim Yayilgan
(Norwegian University of Science and Technology, Norway)
Langue : Anglais (sous-titré en français)
La fenêtre d'action préventive avant que l'IA ne sature la plupart des benchmarks cognitifs se referme
Sans intervention coordonnée, les systèmes d'IA satureront par défaut la plupart des benchmarks cognitifs existants d'ici 2030, approchant ou dépassant les performances d'experts humains sur un large éventail de tâches mesurables. À l'aide d'un modèle bayésien hiérarchique conjoint, nous prévoyons les trajectoires de performance de la frontière sur 63 benchmarks couvrant le raisonnement, les mathématiques, la programmation, les connaissances scientifiques et les capacités agentiques. Nous constatons que la quasi-totalité des benchmarks actuels (97 % de notre ensemble, IC à 80 % : 95–100 %) sont en voie de saturation d'ici quatre ans. Ce résultat est robuste aux choix de modélisation : des analyses de sensibilité portant sur 8 variantes du modèle et trois seuils de saturation montrent que la modification des hypothèses clés conduit à des conclusions qualitativement similaires. Les benchmarks critiques pour la sécurité (cybersécurité, R&D autonome en IA, biologie, chimie) présentent des trajectoires encore plus rapides, atteignant la saturation avant 2028. Pour la communauté de la cybersécurité et de la cyberdéfense, ces résultats soulèvent deux catégories distinctes de risques : (i) le détournement de capacités directement applicables aux opérations offensives (découverte de vulnérabilités, exploitation, utilisation autonome d'ordinateurs, connaissances scientifiques à double usage), et (ii) la perte de contrôle découlant de progrès rapides sur les capacités générales (autonomie, raisonnement agentique et automatisation de la R&D en IA), qui, ensemble, permettent l'émergence d'agents autonomes persistants capables d'accélérer leur propre développement. Si la saturation des benchmarks n'équivaut pas à une intelligence artificielle générale, ces résultats viennent s'ajouter à un faisceau convergent d'éléments indiquant que des performances surhumaines sur les tâches cognitives approchent plus vite qu'on ne le suppose généralement. Étant donné que nous ne comprenons ni ne contrôlons le comportement des modèles GPAI actuels, ce calendrier laisse une marge de manœuvre limitée avant des impacts globaux. Nous présentons les implications pour la doctrine de cyberdéfense, la coordination internationale, la recherche en sûreté de l'IA et les pratiques d'évaluation.
Jérémy Andréoletti
(General-Purpose AI Policy Lab, France)
;
Antoine Maier
(General-Purpose AI Policy Lab, France)
;
Laura Domenech
(General-Purpose AI Policy Lab, France)
;
Tom David
(General-Purpose AI Policy Lab, France)
Langue : Anglais (sous-titré en français)
Intervention invitée
Synthèse de travaux déjà publiés dans une revue ou conférence à comité de lecture, par les mêmes auteurs, rendue accessible à un public plus large.
Travaux répliquant, questionnant ou clarifiant des travaux déjà publiés, afin d'en valider les résultats ou d'en explorer les limites dans d'autres contextes opérationnels.
Éclairages didactiques sur des connaissances pratiques et des retours d’expérience issus des opérations de cybersécurité, couvrant les aspects techniques, juridiques, sociaux ou géopolitiques.
Travaux évaluant, systématisant et contextualisant les connaissances existantes, issues de la recherche ou de la pratique, avec une synthèse claire offrant de nouvelles perspectives.
Travaux initiaux ou en évolution présentant des idées prometteuses et des résultats préliminaires appelés à être confirmés.