Vectorscope

Vectorscope est un outil gratuit, dans le navigateur, qui montre ce qui arrive à une page web sur le chemin de l'index d'un assistant IA : quels passages sont extraits, comment ils se regroupent par sens, et quelle part de la page tombe hors de la limite de récupération et n'est donc jamais lue.

7 min de lectureGEO / recherche IA

Ce qu'il fait, étape par étape

Cinq étapes, et l'outil nomme chacune en la terminant pour qu'une panne soit attribuable. Il récupère l'URL et indique le code de statut obtenu. Il extrait le texte lisible en écartant la navigation, l'habillage et le balisage, et indique quelle fraction du document a survécu. Il découpe ce texte selon la structure H2 et H3 de la page elle-même plutôt que tous les N caractères, si bien qu'un passage arrive avec le titre qui le nomme. Il vectorise chaque passage. Puis il les regroupe par similarité cosinus, à la médiane de la page elle-même, de sorte que les groupes décrivent cette page et non un seuil fixe.

Le découpeur, le modèle de vectorisation et la limite de passages sont ceux que le produit payant exécute en production. Une démonstration sur un pipeline simplifié flatterait le pipeline qu'elle existe pour démontrer, et le chiffre le plus utile de l'outil — quelle part d'une longue page n'atteint jamais un index — n'existe que parce que la vraie limite est appliquée.

Il prend une adresse et vous montre les parties de cette page qu'une machine va réellement lire, et celles qu'elle va sauter.

Vectorscope après la lecture d'une page : un bandeau de cinq chiffres — récupéré, extrait, découpé, vectorisé, regroupé — au-dessus de la page découpée en quatre passages numérotés à gauche et d'un nuage de points de ces passages dans l'espace vectoriel à droite.
Une lecture de getlooploop.com/methodology : 971 mots sont devenus quatre passages, vectorisés en 1024 dimensions et réunis en deux groupes.

Ce que signifient les cinq chiffres

Le bandeau, c'est toute la lecture en cinq nombres, et chacun échoue autrement.

Récupéré est un code de statut et un hôte. Extrait est le rapport du texte lisible au document : une longue page à faible rapport a surtout envoyé de la navigation, et pour tout système de récupération c'est une page courte. Découpé est le nombre de passages obtenus et le nombre de caractères qu'ils contiennent. Vectorisé est le nombre de vecteurs et leur largeur. Regroupé est le nombre de groupes obtenus et combien sont des redites.

Un seul groupe énorme signifie que la page dit la même chose de nombreuses fois : mince pour un moteur de récupération, aussi complète qu'elle paraisse à un rédacteur. Plusieurs groupes d'un seul passage sont le problème inverse : une page qui change constamment de sujet et ne donne rien de complet à citer.

Comment s'en servir sur sa propre page

  • Passez une page sur laquelle vous êtes déjà positionné et lisez d'abord le rapport d'extraction. S'il est faible, la page jette du texte de corps et non de l'habillage, et aucune réécriture n'y changera rien.
  • Cherchez le passage où vit votre réponse. S'il se trouve au-delà de la limite, la solution est de le remonter ou de scinder la page, pas d'ajouter des mots.
  • Posez à la page une question dont vous connaissez la réponse et vérifiez si le premier passage est celui qui la contient. C'est ce qui ressemble le plus à voir un modèle décider à quoi sert votre page.
  • Changez un titre et relancez. Le texte des titres fait un travail de récupération, et c'est la manière la plus rapide de voir à quel point.

Erreurs courantes

  • Lire le nombre de groupes comme une note. C'est la description d'une page, pas un score sur dix, et deux groupes est juste pour une page qui traite deux sujets.
  • Prendre un faible rapport d'extraction pour un problème de rédaction. C'est le plus souvent un problème de rendu : un texte qui n'existe qu'après l'exécution de JavaScript n'a jamais été dans le document.
  • Supposer que les passages reçus par un moteur de récupération sont ceux que voit un lecteur. Une colonne latérale qu'un lecteur ignore est du corps de texte pour un extracteur.
  • Attendre de la lecture qu'elle dise si un assistant vous cite. Elle lit une page isolément ; la citation est une mesure dans le temps sur des requêtes que vous choisissez.

Ce qu'il ne peut pas vous dire

Il ne peut pas dire si un assistant donné a votre page dans son index : personne hors de ces entreprises ne le voit. Il ne peut pas vous comparer à un concurrent, ce qui exige un corpus des deux et non une URL. Il ne peut pas dire si vous êtes cité dans une réponse aujourd'hui, ce qui est une mesure sur des semaines et non une propriété d'une page. Et il ne juge pas l'écriture : il rapporte les décisions qu'un pipeline a prises, ce qui est autre chose que de savoir si la page est bonne.

Un exemple traité

Un guide tarifaire de 4 000 mots fait autorité et renvoie un rapport d'extraction de 0,31, douze passages et un groupe. Le rapport dit que deux tiers du document étaient de l'habillage. Le groupe unique dit que ces douze passages sont presque identiques : la page répète sa promesse douze fois. Un système de récupération interrogé sur les tarifs en reçoit un et n'a aucune raison de préférer cette page à une autre. La solution n'est pas plus de mots ; ce sont douze passages répondant chacun à une question différente.

Questions fréquentes

En quoi cela diffère-t-il d'un audit SEO classique ?

Un audit SEO vérifie si une page peut être explorée et classée. Ceci vérifie si elle peut être citée : ce qu'un passage de récupération extrait, comment il la découpe, et quels passages tombent hors de la limite qu'un modèle lit réellement. Les deux partagent les fondations techniques et divergent sur la structure : un audit récompense une page qui satisfait une requête, ceci récompense un passage qui survit à son extraction.

Est-ce le même pipeline que celui du produit payant ?

Oui : le même découpeur, le même modèle de vectorisation, la même limite de passages. Cela compte pour un chiffre en particulier : la part d'une longue page qui n'atteint jamais un index n'existe comme nombre que parce que la vraie limite est appliquée, et une démonstration simplifiée annoncerait une perte plus faible que la réalité.

Pourquoi ma page se découpe-t-elle en si peu de passages ?

Le plus souvent parce qu'elle a peu de titres. Le découpeur coupe sur la structure H2 et H3 de la page elle-même : une longue page écrite d'un seul trait devient donc une poignée de passages énormes, que le moteur doit prendre ou laisser en entier. Ajouter de vrais titres est la façon la moins chère de changer cela.

Beaucoup de groupes signifie-t-il que la page est bonne ?

Non, et il n'y a pas de bon nombre. Deux groupes est juste pour une page qui traite deux sujets et faux pour une page qui en traite un. Ce sont les extrêmes qui sont parlants : un groupe énorme signifie que la page se répète, et un groupe par passage qu'elle ne tient jamais un sujet assez longtemps pour être citable sur aucun.

Combien cela coûte-t-il, et où est le piège ?

Rien, avec un quota par visiteur pour qu'une personne ne dépense pas le budget du jour : une limite de fréquence, pas un péage, et sans compte. La limite, si l'on veut, est qu'il lit une page à la fois et ne dit rien sur le fait qu'un assistant réponde avec vous.

Demandé à voix haute

dit, non tapé

Le même terme dans les mots employés en parlant à un assistant plutôt qu’en tapant dans un champ de recherche — écrit depuis la situation, et c’est pourquoi chaque question porte la situation dont elle vient.

Notre guide principal n'est pas repris par les réponses des IA et je n'arrive pas à comprendre pourquoi.

Regardez d'abord le rapport d'extraction de la page. La réponse est presque toujours que le corps de texte du guide est minoritaire dans le document — navigation, blocs d'articles liés et balisage font le reste — de sorte qu'une page qui se lit comme quatre mille mots arrive comme huit cents. L'outil donne ce rapport, et aucune réécriture ne corrige un problème de rendu.

une page précisepourquoi est-ce arrivé
Mon responsable veut la preuve que restructurer la page a servi à quelque chose, et pour vendredi.

Passez la page avant et après, et gardez les deux lectures. Le nombre de passages, le rapport d'extraction et la structure des groupes changent visiblement quand les titres changent, et voilà un avant-après que quelqu'un peut regarder. C'est une preuve sur la lisibilité de la page, pas sur le trafic, et il vaut mieux dire laquelle.

une échéancequelqu'un par-dessus l'épaule
Est-ce que je peux vérifier ça depuis mon téléphone avant le début de la réunion ?

Oui. Pas de compte, rien à installer, pas de carte, et une lecture prend une vingtaine de secondes. Collez l'adresse et lisez les cinq chiffres du haut ; le détail en dessous attendra que vous ayez un bureau.

en déplacementun téléphone

Plus dans GEO / recherche IA