Méthodologie
Comment nous décidons de ce que nous vous disons
Chaque rapport est construit à partir de preuves — faits mesurables, signaux d'alerte détectés, inconnues assumées — et le score est calculé par un algorithme déterministe, pas par l'opinion d'une IA. Cette page documente exactement comment, générée à partir du même registre de signaux que celui du scanner.
Ce que nous vérifions
- Historique du domaine — dates d'enregistrement et d'expiration via les données publiques RDAP, registrar, usage de proxy de confidentialité, risques de noms internationalisés (homographes), motifs de noms suspects.
- Technique & sécurité — validité HTTPS et des certificats (inspection TLS directe), comportement des redirections, en-têtes de sécurité, configuration mail DNS (MX, SPF, DMARC) via DNS-over-HTTPS.
- Identité de l'entreprise — informations d'entreprise publiées sur le site (mentions légales, contact, CGV, pages de confidentialité), cohérence entre pages, qualité du contact et vérification dans les registres officiels : l'index suisse Zefix, le Companies House britannique et la validation TVA VIES de l'UE. Les juridictions sans registre pris en charge sont signalées comme Inconnu, jamais comme négatives.
- Cohérence du site — politiques essentielles, contenu de remplissage, devises ou langues mélangées, tactiques de pression, textes juridiques copiés.
- Réputation — mentions indépendantes sur le web, classées prudemment en expériences positives et négatives. Notée uniquement si un fournisseur de recherche est configuré ; sinon affichée ⚪ Inconnu.
- Plausibilité de l'offre — pas encore notée ; apparaît comme ⚪ Inconnu et est totalement exclue du score plutôt que comptée en silence.
Comment fonctionne le score
Chaque constat correspond à un signal avec un impact fixe entre −1 et +1 et un facteur de confiance (faible 0.35, moyen 0.7, élevé 1.0). Par catégorie :
category = clamp(0.5 + Σ(impact × confidence × 0.35), 0, 1) score = weighted mean over evaluated categories × 100 (trust-score-v1.4)
0.5 est la base neutre. Les catégories sans signaux évaluables sont exclues de la moyenne pondérée — une inconnue ne baisse jamais un score. La version de l'algorithme est enregistrée avec chaque analyse pour que les anciens rapports restent interprétables.
80–100🟢 Signaux de confiance solides
60–79🟢 Globalement digne de confiance
40–59🟡 À aborder avec prudence
20–39🟠 Préoccupations importantes
0–19🔴 Risque élevé
Chaque signal que nous notons
57 signaux dans trust-score-v1.4. Les impacts positifs ajoutent de la confiance ; les négatifs la réduisent ; les entrées à impact nul documentent seulement les inconnues.
| Signal | Catégorie | Impact |
|---|---|---|
| BUYER_IDENTITY_CONFLICT | Company identity | 0 |
| BUYER_REGISTRY_CONFLICT | Company identity | 0 |
| BUYER_IDENTITY_COMPARISON | Company identity | 0 |
| BUYER_REGISTRY_COMPARISON | Company identity | 0 |
| BUYER_DETAILS_REUSE | Company identity | 0 |
| BUYER_DETAILS_SEARCH | Company identity | 0 |
| DOMAIN_AGE_VERY_NEW | Domain history | -0.9 |
| DOMAIN_AGE_NEW | Domain history | -0.5 |
| DOMAIN_AGE_RECENT | Domain history | -0.2 |
| DOMAIN_AGE_ESTABLISHED | Domain history | +0.4 |
| DOMAIN_AGE_MATURE | Domain history | +0.8 |
| DOMAIN_EXPIRY_SOON | Domain history | -0.3 |
| DOMAIN_IDN_HOMOGRAPH | Domain history | -0.7 |
| DOMAIN_SUSPICIOUS_PATTERN | Domain history | -0.4 |
| DOMAIN_PRIVACY_PROXY | Domain history | -0.1 |
| DOMAIN_AGE_UNKNOWN | Domain history | 0 |
| HTTPS_MISSING | Technical & security signals | -1 |
| CERT_INVALID_OR_EXPIRED | Technical & security signals | -0.9 |
| HTTPS_VALID | Technical & security signals | +0.6 |
| CERT_ORG_VALIDATED | Technical & security signals | +0.4 |
| REDIRECT_CHAIN_SUSPICIOUS | Technical & security signals | -0.6 |
| SECURITY_HEADERS_PRESENT | Technical & security signals | +0.2 |
| DNS_MX_MISSING | Technical & security signals | -0.2 |
| DNS_SPF_DMARC_PRESENT | Technical & security signals | +0.15 |
| THREAT_LISTED | Technical & security signals | -1 |
| SITE_BLOCKS_AUTOMATED_CHECKS | Technical & security signals | 0 |
| THREAT_CHECK_CLEAR | Technical & security signals | 0 |
| IDENTITY_COMPLETE | Company identity | +0.7 |
| IDENTITY_PARTIAL | Company identity | +0.2 |
| IDENTITY_MISSING | Company identity | -0.8 |
| IDENTITY_INCONSISTENT_NAMES | Company identity | -0.5 |
| IDENTITY_VAT_FORMAT_VALID | Company identity | +0.3 |
| IDENTITY_REG_NUMBER_PRESENT | Company identity | +0.3 |
| CONTACT_FREEMAIL_FOR_COMPANY | Company identity | -0.3 |
| CONTACT_PHONE_PRESENT | Company identity | +0.15 |
| IDENTITY_COPYRIGHT_MISMATCH | Company identity | -0.4 |
| IDENTITY_REGISTRY_VERIFIED | Company identity | +0.8 |
| IDENTITY_REGISTRY_NOT_FOUND | Company identity | -0.3 |
| IDENTITY_VAT_VERIFIED | Company identity | +0.4 |
| IDENTITY_VAT_INVALID | Company identity | -0.5 |
| IDENTITY_CERT_ORG_REGISTERED | Company identity | +0.6 |
| IDENTITY_UNVERIFIED_NO_REGISTRY | Company identity | 0 |
| REPUTATION_NO_MENTIONS | Reputation | -0.2 |
| REPUTATION_LIMITED | Reputation | -0.1 |
| REPUTATION_ESTABLISHED | Reputation | +0.6 |
| REPUTATION_MIXED | Reputation | -0.3 |
| REPUTATION_NEGATIVE_PATTERN | Reputation | -0.6 |
| POLICY_PAGES_PRESENT | Website consistency | +0.5 |
| POLICY_MISSING_ESSENTIAL | Website consistency | -0.6 |
| POLICY_MISSING_NON_SHOP | Website consistency | -0.15 |
| POLICY_COMPANY_MISMATCH | Website consistency | -0.8 |
| CONTENT_PLACEHOLDER_TEXT | Website consistency | -0.7 |
| CONTENT_MIXED_CURRENCY_LANGUAGE | Website consistency | -0.3 |
| CONTENT_URGENCY_SCARCITY | Website consistency | -0.4 |
| CONTENT_COPIED_LEGAL_TEXT | Website consistency | -0.3 |
| CONTENT_STRUCTURE_PROFESSIONAL | Website consistency | +0.3 |
| CONTENT_ANALYSIS_UNAVAILABLE | Website consistency | 0 |
Où l'IA intervient — et où elle n'intervient pas
L'IA fait
- extraire les informations d'entreprise du texte des pages
- classer les signaux d'alerte de contenu en catégories fixes
- décrire les motifs visuels des images
- rédiger le résumé en langage clair
L'IA ne fait jamais
- fixer ou ajuster le score de confiance
- déterminer l'âge du domaine, le DNS ou les certificats
- déclarer quoi que ce soit comme arnaque
- passer outre les preuves collectées
Analyse de texte IA
Les verdicts texte de « C'est de l'IA ? » proviennent de trois signaux indépendants, chacun affiché de façon transparente dans le rapport :
- Analyse statistique — burstiness (variation de la longueur des phrases ; l'écriture humaine varie davantage), diversité du vocabulaire, formulations répétées, variété de la ponctuation et densité de tournures typiques de l'IA.
- Perplexité de modèle de langage — nous exécutons un petit modèle de langage (distilgpt2) sur nos propres serveurs et mesurons la prévisibilité du texte pour lui. Un texte généré par IA est typiquement bien plus prévisible qu'une écriture humaine. Anglais uniquement ; les autres langues sont signalées comme non concluantes plutôt que devinées.
- Revue de style — un modèle de langage recherche des caractéristiques couramment associées à une écriture assistée par IA.
Un seul signal ne produit jamais plus que « Quelques caractéristiques de type IA » ; le verdict le plus fort exige l'accord de signaux indépendants, et aucun pourcentage n'est jamais affiché. La détection de texte IA ne doit jamais être l'unique base de décisions académiques, professionnelles, juridiques ou disciplinaires.
Analyse d'image IA
Les verdicts « C'est de l'IA ? » suivent une hiérarchie stricte des preuves : les Content Credentials C2PA vérifiées cryptographiquement priment sur les métadonnées de générateur (marqueurs Midjourney, Stable Diffusion, Firefly, DALL-E), qui priment sur un EXIF d'appareil photo cohérent, qui prime sur les observations visuelles d'un modèle de vision. Les observations visuelles seules ne peuvent jamais produire plus que « Probablement généré par IA » à confiance moyenne, et les résultats ne sont jamais présentés comme des preuves. Les détecteurs non configurés sont clairement signalés et ignorés par le verdict.
Sources que nous vérifions
Chaque vérification d'identité d'entreprise et de domaine est résolue auprès de ces registres et spécifications publics. Nous les lions pour que vous puissiez refaire chaque vérification vous-même.
- RDAP (Registration Data Access Protocol) — registration and expiry dates, registrar, privacy-proxy use
- Zefix — Swiss Central Business Names Index — Swiss company register verification
- UK Companies House — UK company register verification
- EU VIES VAT validation — EU VAT number validation
- C2PA Content Credentials — cryptographically signed provenance for AI-image checks
- DNS-over-HTTPS (RFC 8484) — MX, SPF and DMARC mail configuration lookups
Limites & indépendance
- Un score élevé est un réconfort fondé sur des preuves, pas une garantie ; un score bas est un ensemble de préoccupations, pas une accusation.
- Certains registres (certains domaines nationaux) n'exposent pas les données d'enregistrement — ces requêtes deviennent Inconnu, pas négatives.
- Les sites derrière une protection anti-bot agressive peuvent n'être que partiellement analysables ; les rapports le disent explicitement.
- Les scores de confiance ne s'achètent pas. Il n'existe aucun moyen payant d'améliorer un score, et il n'y en aura jamais.
- Les propriétaires de sites peuvent contester les constats — contactez-nous avec des documents vérifiables et nous réexaminerons les preuves.
Des questions ou une contestation ? Rendez-vous sur la page contact.