Qué hace, paso a paso
Cinco pasos, y la herramienta nombra cada uno al terminarlo para que un fallo tenga dueño. Obtiene la URL e informa del código de estado. Extrae el texto legible descartando navegación, plantilla y marcado, e informa de qué fracción del documento sobrevivió. Divide ese texto siguiendo la propia estructura de H2 y H3 de la página en lugar de cada N caracteres, así que un pasaje llega con el titular que lo nombra. Vectoriza cada pasaje. Y luego los agrupa por similitud del coseno, en la mediana de la propia página, de modo que los grupos describen esta página y no un umbral fijo.
El divisor, el modelo de vectorización y el límite de pasajes son los que el producto de pago ejecuta en producción. Una demo sobre un pipeline simplificado adularía al pipeline que existe para demostrar, y la cifra más útil de la herramienta —cuánto de una página larga no llega nunca a un índice— solo existe porque se aplica el límite real.
Toma una dirección y te muestra las partes de esa página que una máquina va a leer de verdad, y las que se va a saltar.

Qué significan las cinco cifras
La franja es toda la lectura en cinco números, y cada uno falla de una manera distinta.
Obtenido es un código de estado y un host. Extraído es la proporción de texto legible sobre el documento: una página larga con proporción baja envió sobre todo navegación, y para cualquier sistema de recuperación es una página corta. Dividido es en cuántos pasajes se convirtió la página y cuántos caracteres contienen. Vectorizado es el número de vectores y su anchura. Agrupado es en cuántos grupos cayeron los pasajes y cuántos son repeticiones.
Un grupo enorme significa que la página dice lo mismo muchas veces: fina para un recuperador, por minuciosa que le parezca a un editor. Varios grupos de un solo pasaje son el problema contrario: una página que cambia de tema constantemente y no le da al recuperador nada completo que citar.
Cómo usarla en una página propia
- Pasa una página por la que ya posicionas y lee primero la proporción de extracción. Si es baja, la página descarta texto del cuerpo y no plantilla, y eso no lo arregla ninguna reescritura.
- Busca el pasaje donde vive tu respuesta. Si queda más allá del límite, la solución es subirlo o partir la página, no añadir palabras.
- Hazle a la página una pregunta cuya respuesta conoces y comprueba si el pasaje principal es el que la contiene. Es lo más parecido a ver a un modelo decidir para qué sirve tu página.
- Cambia un titular y vuelve a pasarla. El texto de los titulares hace trabajo de recuperación, y esta es la forma más rápida de ver cuánto.
Errores frecuentes
- Leer el número de grupos como una nota. Es la descripción de una página, no un cinco sobre diez, y dos grupos es lo correcto para una página sobre dos cosas.
- Tomar una proporción baja de extracción por un problema de redacción. Suele ser un problema de renderizado: el texto que solo existe después de ejecutar JavaScript nunca estuvo en el documento.
- Suponer que los pasajes que recibe un recuperador son los que ve un lector. Una barra lateral que el lector ignora es cuerpo de texto para un extractor.
- Esperar que la lectura diga si un asistente te cita. Lee una página aislada; la citación es una medición en el tiempo sobre consultas que tú eliges.
Qué no puede decirte
No puede decir si un asistente concreto tiene tu página en su índice: eso no lo ve nadie fuera de esas empresas. No puede compararte con la competencia, que requiere un corpus de ambos y no una URL. No puede decir si hoy te citan en una respuesta, que es una medición de semanas sobre un conjunto de consultas y no una propiedad de una página. Y no juzga la redacción: informa de las decisiones que tomó un pipeline, que es otra cosa que si la página es buena.
Un ejemplo trabajado
Una guía de precios de 4.000 palabras parece autorizada y devuelve una proporción de extracción de 0,31, doce pasajes y un grupo. La proporción dice que dos tercios del documento eran adorno. El grupo único dice que esos doce pasajes son casi idénticos: la página repite su promesa doce veces. Un sistema de recuperación preguntado por precios recibe uno de ellos y no tiene ningún motivo para preferir esta página a otra. La solución no son más palabras: son doce pasajes que respondan cada uno a una pregunta distinta.
Preguntas frecuentes
¿En qué se diferencia de una auditoría SEO normal?
Una auditoría SEO comprueba si una página se puede rastrear y posicionar. Esto comprueba si se puede citar: qué extrae un paso de recuperación, cómo la parte y qué pasajes quedan fuera del límite que un modelo lee de verdad. Comparten los cimientos técnicos y divergen en la estructura: una auditoría premia una página que satisface una consulta, esto premia un pasaje que aguanta que lo saquen de la página.
¿Es el mismo pipeline que usa el producto de pago?
Sí: el mismo divisor, el mismo modelo de vectorización y el mismo límite de pasajes. Importa para una cifra en particular: cuánto de una página larga no llega nunca a un índice solo existe como número porque se aplica el límite real, y una demo simplificada informaría de una pérdida menor que la verdadera.
¿Por qué mi página se parte en tan pocos pasajes?
Normalmente porque tiene pocos titulares. El divisor corta siguiendo la estructura de H2 y H3 de la propia página, así que una página larga escrita como un argumento continuo se convierte en un puñado de pasajes enormes, cada uno de los cuales un recuperador debe tomar o dejar entero. Añadir titulares reales es la forma más barata de cambiarlo.
¿Muchos grupos significan que la página es buena?
No, y no hay un número bueno. Dos grupos es correcto para una página sobre dos cosas e incorrecto para una sobre una. Lo diagnóstico son los extremos: un grupo enorme significa que la página se repite, y un grupo por pasaje que nunca se queda en un tema el tiempo suficiente para ser citable en ninguno.
¿Cuánto cuesta y dónde está la trampa?
Nada, con un cupo por visitante para que una persona no gaste el presupuesto del día: un límite de frecuencia, no un muro de pago, y sin cuenta. El límite, si se le puede llamar así, es que lee una página a la vez y no dice nada sobre si un asistente responde contigo.
Preguntado en voz alta
dicho, no escritoEl mismo término en las palabras que alguien usa al hablar con un asistente en lugar de escribir en un buscador: escrito desde la situación, y por eso cada pregunta lleva la situación de la que salió.
Mira primero la proporción de extracción de la página. Casi siempre la respuesta es que el cuerpo de texto de la guía es una minoría del documento —navegación, bloques de artículos relacionados y marcado son el resto—, así que una página que se lee como cuatro mil palabras llega como ochocientas. La herramienta informa de la proporción, y ninguna reescritura arregla un problema de renderizado.
Pasa la página antes y después y guarda las dos lecturas. El número de pasajes, la proporción de extracción y la estructura de grupos cambian de forma visible cuando cambian los titulares, y eso es un antes y un después que alguien puede mirar. Es evidencia sobre la legibilidad de la página, no sobre el tráfico, y conviene decir cuál de las dos.
Sí. Sin cuenta, sin instalar nada y sin tarjeta, y una lectura tarda unos veinte segundos. Pega la dirección y lee las cinco cifras de arriba; el detalle de debajo es para cuando tengas un escritorio.