Vectorscopelo que la máquina lee de verdad
división por encabezadosmáx. 26 fragmentos / páginaagrupado por cosenosin cuenta

Gratis, sin cuentaExperimental

Pega una URL. Mira qué sobrevive el viaje al espacio vectorial.

Prueba:
Descargada
Extraído
Dividida
Vectores
Agrupado

Un límite gratuito por visitante, sin necesidad de cuenta.

Esperando una URL

Cómo leer tu resultado

Cinco números deciden si una página es legible para un sistema de recuperación. Esto es lo que significa cada uno cuando va mal.

Fragmentos que nunca llegan al índice

Un sistema de recuperación lee un número fijo de fragmentos de una página e ignora el resto, así que todo lo que queda por debajo de ese corte es invisible por bueno que sea. Vectorscope aplica el mismo límite que el producto y nombra los fragmentos que se quedaron fuera.

Si tu respuesta, tu precio, tu diferencia o tu FAQ están por debajo del corte, la solución no es más texto. Es subir ese fragmento, o dividir la página para que tenga su propio presupuesto de fragmentos.

La proporción de extracción

La proporción de extracción es cuánto de la página se convirtió en texto legible; una baja significa que la mayor parte de lo que publicaste era navegación, plantilla o marcado que ningún modelo verá. Una página larga con una proporción baja es una página corta para la recuperación.

Causas habituales, por frecuencia: texto que solo dibuja JavaScript; un artículo envuelto en tanto armazón que el cuerpo es minoría del documento; e imágenes que llevan palabras que no existen en el HTML.

Grupos, y qué significa un grupo apretado

Los grupos son fragmentos que el embedding considera sobre lo mismo, y un grupo enorme suele significar que la página dice una cosa muchas veces. Eso se lee como pobre para un recuperador aunque se lea como exhaustivo para un editor.

Varios grupos pequeños de un fragmento cada uno es el problema contrario: una página que cambia de tema constantemente no le da al recuperador nada completo que citar.

El fragmento que una pregunta recupera de verdad

Preguntarle a la página devuelve los fragmentos que responden, ordenados, usando solo esa página — lo más cerca que se puede estar de ver a un modelo decidir para qué sirve tu página. Si el fragmento devuelto no es el que habrías elegido, la página no está organizada como crees.

También es la forma más rápida de probar un titular reescrito: cambia el titular, vuelve a pasar la página, haz la misma pregunta.

¿Qué es el fragmentado semántico?

El fragmentado semántico es dividir una página por las líneas donde cambia su significado, en lugar de cada N caracteres. Es el paso entre leer una página y generar sus embeddings, y decide qué puede citar un modelo.

01

Fragmentado de longitud fija

El fragmentado de longitud fija corta cada N caracteres y es el predeterminado en casi todos los pipelines porque es trivial de implementar. También corta en medio de una frase, separa un titular de la respuesta que lleva debajo y produce fragmentos que empiezan con media palabra.

Es rápido, barato y repetible, y es la razón de que tantas páginas se recuperen mal para preguntas que responden perfectamente.

02

Fragmentado que respeta los titulares

El fragmentado que respeta los titulares usa la propia estructura H2 y H3 de la página como líneas de corte, así que un fragmento llega con el titular que lo nombra. Es lo primero que hace Vectorscope, y para la mayoría de páginas es la mayor mejora disponible.

También significa que el texto de tus titulares trabaja para la recuperación. Una sección llamada «Resumen» no aporta nada al fragmento; una llamada «¿Cuánto cuesta?» aporta la pregunta misma.

03

Fragmentado semántico, y lo que cuesta

El fragmentado semántico compara bloques vecinos y corta donde se desplaza el significado, lo que produce fragmentos que se sostienen solos pero cuesta una pasada de embeddings sobre la página antes de cualquier recuperación. Por eso un fragmentador puede ser lento y por eso el resultado vale la pena.

Nada de esto está libre de juicio: un corte es una decisión sobre dónde termina una idea. Vectorscope te muestra las decisiones en lugar de una puntuación, porque una puntuación las esconderría.

¿Está mi contenido listo para la búsqueda con IA?

Esta página responde a eso para una URL a la vez, con honestidad — lo que significa nombrar lo que no puede ver con la misma claridad que lo que sí.

Lo que esta herramienta puede decirte

  • Cuánto de tu página se convierte en texto legible, como proporción y no como adjetivo.
  • Qué fragmentos exactos recibiría un recuperador, en orden, con los que quedan fuera del límite marcados.
  • Si tus fragmentos se sostienen solos o dependen del anterior para tener sentido.
  • Qué fragmento recupera una pregunta real de tu página, con los embeddings de la propia página.
  • Si la página pide no ser indexada: una directiva noindex se informa, no se ignora.

Lo que no puede decirte

  • Si un asistente concreto tiene tu página en su índice. Nadie fuera de esas empresas lo ve.
  • Cómo clasifica un modelo tu página frente a la de un competidor. Eso necesita un corpus de ambas, que es el producto y no la demo.
  • Si te citan hoy en una respuesta. Eso es una medición en el tiempo sobre prompts que tú eliges, no una propiedad de una página.

Usar Vectorscope para probar un pipeline RAG

Si construyes recuperación en lugar de contenido, esta página es una implementación de referencia que puedes apuntar a cualquier URL en unos veinte segundos.

  1. 1Pasa una página que ya indexas y compara los límites de fragmento con los de tu fragmentador.
  2. 2Mira la proporción de extracción: si la tuya es menor en la misma URL, tu extractor está descartando cuerpo de texto, no armazón.
  3. 3Hazle a la página una pregunta cuya respuesta conoces y comprueba si el fragmento superior es el que la contiene.
  4. 4Pasa una página deliberadamente larguísima. Los fragmentos más allá del límite son los que tu propio top-k tampoco alcanzará.

El fragmentador, el modelo de embeddings y el límite aquí son los que el producto ejecuta en producción. Una demo con un pipeline simplificado halagaría al pipeline que existe para demostrar.

Palabras usadas en esta página

Cuatro términos, definidos una vez, porque una página que los usa sin definirlos es una página que un asistente no puede explicarle a nadie.

Fragmento (chunk)
Un pasaje de una página, cortado para poder leerse por sí solo. Los sistemas de recuperación guardan y devuelven fragmentos, nunca páginas completas, y por eso la estructura importa más que la longitud.
Embedding
Una lista de números que representa el significado de un pasaje, de modo que dos pasajes sobre lo mismo quedan cerca. Comparar embeddings es cómo un recuperador encuentra un pasaje sin coincidencia de palabras.
Similitud coseno
Una medida de cuánto apuntan dos embeddings en la misma dirección, de 1 para idénticos a 0 para no relacionados. Es el número detrás de toda afirmación de que dos pasajes tratan de lo mismo.
Generación aumentada por recuperación (RAG)
Responder recuperando primero pasajes de una fuente y escribiendo después a partir de ellos, en vez de solo desde la memoria del modelo. Toda respuesta de IA que cita una página hizo esto, y la página que citó era un fragmento.
Extracción
Convertir un documento HTML descargado en el texto legible que recibe un modelo, descartando navegación, scripts y plantilla. Lo que la extracción descarta, ningún modelo lo ve.

Preguntas que la gente hace sobre esto

¿Cómo elige AI Mode las fuentes que cita?

Nadie fuera de Google puede afirmar el mecanismo, y esta página no va a fingirlo. Lo observable es que las páginas citadas suelen contener un pasaje que responde la consulta completa por sí solo, y que las páginas cuya respuesta se reparte entre varias secciones se citan menos de lo que su contenido merece. Vectorscope te muestra si tu página tiene tal pasaje.

¿Cómo consigo que me citen en AI Overviews?

Dale a la respuesta su propio pasaje, bajo un titular que nombre la pregunta, lo bastante arriba para sobrevivir al límite de recuperación. No es un truco: es la forma que la recuperación premia, y puedes comprobar si tu página la tiene pasándola por aquí.

¿Es una herramienta de visualización de embeddings?

Sí, para una página a la vez. Genera embeddings de cada pasaje de una URL y los agrupa por significado, así ves qué partes de la página están cerca y cuáles se sostienen solas. No dibuja un corpus de miles de documentos.

¿Qué diferencia hay entre fragmentado por titulares y semántico?

El fragmentado por titulares corta en los titulares de la página; el semántico corta donde cambia el significado, haya titular o no. Esta herramienta hace ambos, en ese orden, que es lo que debería hacer un pipeline de producción.

¿Guardáis la página que pruebo?

La lectura se conserva brevemente para poder compartirla con un enlace, y la página descargada no se retiene después de producirla. No hay cuenta, así que no hay nada a lo que vincularla.

¿Es gratis de verdad?

Sí, con un límite de frecuencia en lugar de un muro de pago. El límite existe porque cada lectura cuesta una llamada de embeddings, y se reinicia en una ventana fija que la página te avisa antes de que la alcances.

Seguir leyendo

Respuestas más largas a las preguntas que esta página solo puede resumir.

Lo que esto no puede enseñarte

Una página aislada. Si esa página responde a lo que la gente pregunta de verdad a un asistente, cómo se sostiene frente a la página de un competidor sobre el mismo tema, y para qué temas no tienes página alguna: eso necesita el corpus del sitio entero, medido en el tiempo.

Pedir una invitación