Notastool9 min

Qué lee un asistente de IA cuando lee su página

Construimos una herramienta que procesa una URL mediante la misma extracción, segmentación e incrustación que utiliza un sistema de recuperación, y la aplicamos a seis páginas reales — incluida la nuestra. El número que esperábamos que importara no lo fue. Esto es lo que sí ocurrió.

Traducido del original en inglés.

La consola de Vectorscope: un campo URL, dos enlaces de ejemplo y una tira de cinco pasos que muestra la lectura obtenida, extraída, segmentada, incrustada y agrupada.

La respuesta corta

what
Vectorscope muestra los pasajes que un asistente de IA recibe de una URL, y cuáles nunca alcanza.
why
La recuperación lee pasajes, nunca páginas completas, por lo que la estructura de la página decide lo que puede citarse.
who
Cualquiera cuyas páginas son leídas por un asistente, y cualquiera que construya recuperación sobre páginas que no controla.
where
Gratis en getlooploop.com/vectorscope, una URL a la vez, sin cuenta.
when
Cada recuperación, no solo al publicar: el recorte ocurre cada vez que un modelo accede a la página.
how
Obtiene la URL, extrae el texto legible, corta en los encabezados y después según el significado, incrusta cada pasaje y los agrupa.

Explicación sencilla

Un robot no puede leer toda su página de una vez, por eso la divide en fragmentos y lee solo algunos. Esta herramienta muestra los fragmentos. Si el fragmento que contiene su respuesta se parte por la mitad, o si es el fragmento número cuarenta y el robot solo lee veintiséis, su respuesta está disponible para las personas y falta para el robot.

Un sistema de recuperación nunca lee su página. Lee fragmentos de la misma — un puñado, seleccionados por su similitud con una pregunta — y el resto del contenido de la página puede considerarse inexistente para esa respuesta. No se trata de un detalle de la implementación de un producto. Es lo que es la generación aumentada por recuperación, y lo ha sido desde el el artículo que lo nombró en 2020: recuperar fragmentos y luego redactar a partir de ellos.

Por lo tanto, la cuestión interesante sobre una página no es cuán buena es. Es qué fragmentos recibiría un recuperador, en qué orden, y si el que contiene su respuesta está entre ellos.

Construimos Vectorscope para responder a eso una URL a la vez, y ejecuta la canalización real — el mismo chunker (segmentador), el mismo modelo de incrustación, el mismo passage cap (límite de fragmentos) que aplica el producto de pago. Una demostración que ejecuta una versión simplificada halagaría la canalización que existe para demostrar.

La consola de Vectorscope: un campo URL, dos enlaces de ejemplo y una tira de cinco pasos que muestra los datos obtenidos, extraídos, fragmentados, incrustados y agrupados.
Toda la interfaz. Un campo, cinco pasos y los tres hechos que determinan si alguien lo prueba — gratuito, sin cuenta y el mismo fragmentador que usa el producto.

Seis páginas, y el número que resultó no importar

Ejecutamos seis páginas: una guía de un proveedor sobre un formulario fiscal, tres páginas de referencia y documentación, un artículo enciclopédico muy extenso y nuestra propia página Vectorscope. Cada cifra que se muestra a continuación se obtuvo con la herramienta el 19 de agosto de 2026, usando la canalización desplegada — embeddings voyage-4-lite de 1 024 dimensiones y un límite de 26 pasajes por página.

páginapalabraspasajestexto nunca leídogruposautosemejanza
Transformer, Wikipedia14,16326 — cap53.3%50.698
Search engine optimization, Wikipedia5,047240%60.708
SEO Starter Guide, Google3,955190%50.720
W-9 guide, Tipalti4,441230%40.730
Cosine similarity, Wikipedia3,100140%20.760
Vectorscope, ours1,55660%30.854
Seis lecturas realizadas el 19 de agosto de 2026 contra el pipeline desplegado. Nada aquí está redondeado para favorecerlo: la fila donde más de la mitad de la página no se leyó corresponde a una página que elegimos porque es larga, y la peor autosemejanza es la nuestra.

El número que esperábamos que fuera la historia era la cuarta columna: cuánto de una página nunca llega al índice. En cinco de seis páginas era cero. No cercano a cero — cero. No se perdió nada, porque ninguna de esas páginas era lo suficientemente larga como para superar el techo.

Muerde una sola vez, y muerde fuerte. El artículo de Wikipedia sobre transformers tiene 14,163 palabras; el recuperador recibió 26 pasajes que contenían 47,275 caracteres y dejó 53,903 caracteres sin leer — 53.3% de la página. Más de la mitad de la explicación más enlazada de la arquitectura detrás de cada modelo mencionado aquí no está, en cuanto a una pasada de recuperación, presente.

La lección es más concreta que el consejo habitual y más útil: la longitud de la página no es un problema de recuperación hasta que es enorme, y entonces es grave. Por debajo de aproximadamente cinco mil palabras, el techo no es lo que le está costando.

Pasajes recibidos por el recuperador, por página (límite: 26)

Transformer, Wikipedia26
SEO, Wikipedia24
Guía W-9, Tipalti23
Guía de inicio SEO, Google19
Similaridad coseno, Wikipedia14
Vectorscope, nuestro6
Sólo la fila superior alcanzó el límite. Todo lo que está debajo se leyó completo, por lo que el límite no es relevante hasta que una página sea enorme.

Pruébelo en una página propia

Vea qué encuentra Volatilidad de las respuestas de IA en una página suya

Todo lo anterior se puede medir en su propio trabajo, y la comprobación lleva cerca de un minuto. Pegue una dirección y lea lo que vuelve.

Abrir Volatilidad de las respuestas de IA

Gratis · sin cuenta · una cada vez

Qué difiere: cuánto se repite una página

Observe la última columna. La auto‑similitud es la media de la similitud coseno entre los propios pasajes de una página — cuán parecidos son entre sí las partes de una página. Las seis páginas varían entre 0.698 y 0.854, y el orden no corresponde al de sus recuentos de palabras.

Un número bajo indica que la página cubre terreno. El artículo de Wikipedia sobre SEO, con 0.708, tiene seis grupos, uno de ellos un único pasaje sobre mercados internacionales que no se asemeja a ningún otro contenido de la página — se trata de una página con una sección realmente separada, y un recuperador que consulta sobre SEO internacional dispone de algo concreto que devolver.

Un número alto indica que la página repite una idea muchas veces. Eso nos lleva a la parte incómoda.

Autosemejanza: cuán semejantes son los propios pasajes de una página

Vectorscope, la nuestra0.854
Cosine similarity, Wikipedia0.760
W-9 guide, Tipalti0.730
SEO Starter Guide, Google0.720
SEO, Wikipedia0.708
Transformer, Wikipedia0.698
Un valor más alto indica que la página dice una cosa muchas veces. Nuestra propia página es la peor de las seis, y es la página que más observamos.

Lo probamos en nosotros mismos y quedamos últimos

Nuestra propia página de Vectorscope obtuvo 0,854 — la más alta, por mucho, en seis páginas que no elegimos para halagarnos. Sus 1.556 palabras se convirtieron en seis pasajes distribuidos en tres grupos, uno de los cuales es un único pasaje y otro contiene cuatro. En términos simples: la página formula un argumento, de forma repetida, con palabras ligeramente distintas.

Peor, 1.994 de sus 10.235 caracteres extraídos — 19 % — se clasificaron como utilidad y no como contenido principal: navegación, controles, la franja de chips superior. En la guía W‑9 la cifra equivalente fue 434 caracteres de 29.270, lo que representa el 1,5 %.

No vamos a pretender que se trata de un hallazgo sutil. Desde entonces, la página ha añadido ocho secciones de explicación real bajo la herramienta, y la lectura anterior se realizó después de esa incorporación; antes habría sido peor. Es la demostración más clara que tenemos de que la medida es útil: nos indicó algo verdadero que no queríamos escuchar, sobre la página que más consultamos.

La medida vale la pena porque nos dijo algo verdadero que no queríamos escuchar, sobre la página que más consultamos.

Al obtener una puntuación de 0.854

Las tres formas de dividir una página y por qué la del medio es la más importante

Chunking es el paso que nadie ve y por el que todos son evaluados.

Fixed-length chunking corta cada N caracteres. Es la opción predeterminada en la mayoría de los pipelines porque es trivial de implementar, corta por la mitad de las frases, separa un encabezado de la respuesta que lo sigue y genera pasajes que empiezan con medio palabra. Es rápido, barato, repetible y la causa de que muchas páginas recuperen mal las preguntas que responden perfectamente.

Heading-aware chunking utiliza la propia estructura H2 y H3 de la página como líneas de corte, de modo que un pasaje llega con el encabezado que lo nombra. Es la mejora única más grande disponible para la mayoría de las páginas, y tiene una consecuencia que la gente pasa por alto: el texto de su encabezado ahora realiza trabajo de recuperación. Una sección llamada "Overview" no aporta nada al pasaje que la sigue. Una sección llamada "How much does it cost?" aporta la propia pregunta.

Semantic chunking compara bloques vecinos y corta donde cambia el significado, exista o no un encabezado. Genera pasajes autónomos y requiere una pasada de embedding sobre la página antes de que se produzca cualquier recuperación.

Ninguna de las tres está libre de juicio. Un corte es una decisión sobre dónde termina una idea, y Vectorscope le muestra las decisiones en lugar de una puntuación, porque una puntuación las ocultaría.

Tres tarjetas en la página que comparan la fragmentación de longitud fija (fixed-length chunking), la fragmentación sensible a encabezados (heading-aware chunking) y la fragmentación semántica (semantic chunking).
Las tres estrategias, en la propia página. Están numeradas porque forman una progresión: cada una es la anterior con su peor fallo corregido.

Lo que no puede decirle

Tres cosas, y preferimos indicarlas aquí antes de que alguien las descubra y concluya que la herramienta se promociona en exceso.

No puede decirle si algún asistente concreto tiene su página en su índice. Nadie fuera de esas compañías puede verlo, y una herramienta que afirme lo contrario está inferiendo a partir de algo que no nombrará.

No puede decirle cómo un modelo clasifica su página frente a la de un competidor. Eso requiere un corpus de ambas páginas, que es el producto y no la demostración.

No puede decirle si ha sido citado en una respuesta hoy. Es una medición en el tiempo, sobre los prompts que usted elija, y constituye un instrumento distinto.

Lo que sí puede hacer es mostrarle, con exactitud, los fragmentos que un recuperador recibe de una URL, que es la parte de la cadena que todos suponen.

Dos columnas de igual peso, tituladas lo que esta herramienta puede decir y lo que no puede decir, con cinco puntos y tres.
Los rechazos obtienen una columna propia, del mismo tamaño que las afirmaciones. Esta es la sección que cita un asistente cuando alguien pregunta si la herramienta es útil.

Si se construye la recuperación en lugar del contenido

La misma página funciona como una implementación de referencia a la que se puede apuntar con cualquier URL:

  • Ejecute una página que ya haya indexado y compare los límites de los pasajes con los de su segmentador.
  • Compare las tasas de extracción en la misma URL. Si la suya es inferior, su extractor está descartando el texto del cuerpo, no el texto estándar.
  • Formule a la página una pregunta cuya respuesta conozca y compruebe que el pasaje principal es el que la contiene.
  • Ejecute una página que sea demasiado larga. Los pasajes que superan el límite son los que su propio top‑k nunca alcanzará.

Fuentes y dónde seguir leyendo

Nuestra propia methodology page incluye todas las fórmulas que emplea el producto y lo que cada número puede afirmar.

Un glosario que define chunk, embedding, cosine similarity, retrieval-augmented generation y extraction.
Cinco términos, definidos una vez. Una página que utiliza estas palabras sin definirlas es una página que un asistente no puede explicar a nadie, lo que también constituye el argumento del artículo.

Preguntas que recibe este artículo

¿Siempre es malo una alta auto‑similitud?

No. Una página que responde a una única pregunta concreta debe ser internamente similar. Forzar variedad la empeoraría. El problema aparece cuando una página es larga, afirma cubrir varios temas y sigue obteniendo una puntuación alta. Eso indica que la página se repite en lugar de cubrirlos.

¿Un límite de 26 pasajes implica que el asistente solo lee 26 pasajes?

Significa que esta canalización indexa como máximo 26 elementos de una página, un techo deliberado que aplica el producto. Todos los sistemas de recuperación tienen ese límite y ninguno lo publica. El dato que se extrae de la prueba anterior no es 26; es que más de la mitad de una página de 14 000 palabras quedó sin leer bajo uno, y la vuestra también lo hará.

¿Por qué la herramienta muestra una proporción de extracción en lugar de una puntuación?

Porque una puntuación ocultaría las decisiones. Dos páginas pueden tener la misma puntuación por motivos opuestos, y la corrección difiere: una necesita que su texto principal se recupere del marcado, la otra necesita que su respuesta se coloque por encima del corte.

¿Se ha leído una página de la competencia en la prueba? ¿Es justo?

Las seis páginas son URLs públicas que cualquiera puede pegar en la herramienta, y las lecturas no revelan nada que un visitante no pueda obtener por sí mismo en veinte segundos. Incluimos nuestra propia página en el conjunto y quedó en último lugar en la métrica que más nos importa.

El producto

Véalo en cada página, cada día

Una lectura dice dónde está una página hoy. El producto hace las mismas preguntas a los mismos asistentes de forma continua, así que un cambio es algo que se le cuenta y no algo que tenga que ir a buscar.

Pedir una invitación

Solo por invitación mientras mantenemos honestas las lecturas

Autor

GetLoopLoop AIautor

Más de 15 años en marketing y SEO. Decenas de productos, sobre todo el mercado estadounidense. Investigación y medición.

LinkedIn

Pass it on

Read in your language

Opens a browser translation of this English article. The original source stays in English.

Todo lo que hay aquí se puede medir en sus propias páginas. Pase una por Vectorscope — sin cuenta, una URL a la vez.