Vectorscopeщо машина справді читає
поділ за заголовкамидо 26 фрагментів / сторінкугрупування за косинусомбез акаунта

Безкоштовно, без акаунтаЕкспериментальне

Вставте URL. Подивіться, що переживе подорож у векторний простір.

Спробуйте:
Завантажено
Вилучено
Поділено
Вектори
Згруповано

Безкоштовний ліміт на відвідувача, акаунт не потрібен.

Чекаю на URL

Як читати свій результат

П’ять чисел вирішують, чи є сторінка читабельною для системи пошуку. Ось що кожне з них означає, коли воно погане.

Фрагменти, які не доходять до індексу

Система пошуку читає зі сторінки фіксовану кількість фрагментів, а решту ігнорує, тож усе нижче цієї межі невидиме, яким би добрим воно не було. Vectorscope застосовує ту саму межу, що й продукт, і називає фрагменти, які за неї вийшли.

Якщо ваша відповідь, ціна, відмінність або FAQ лежать нижче межі, лікується це не додаванням слів. Лікується це підняттям цього фрагмента вище або розділенням сторінки, щоб вона мала власний бюджет фрагментів.

Коефіцієнт видобутку

Коефіцієнт видобутку — це те, яка частина сторінки перетворилася на читабельний текст; низький означає, що більшість того, що ви випустили, була навігацією, шаблоном або розміткою, якої жодна модель не побачить. Довга сторінка з низьким коефіцієнтом — це коротка сторінка з погляду пошуку.

Типові причини, у порядку частоти: текст, який малює лише JavaScript; стаття, обгорнута такою кількістю обв’язки, що тіло становить меншість документа; і зображення, які несуть слова, відсутні в HTML.

Групи, і що означає щільна група

Групи — це фрагменти, які ембединг вважає про одне й те саме, і одна велика група зазвичай означає, що сторінка каже одну річ багато разів. Для пошуку це читається як тонко, навіть якщо для редактора читається як ґрунтовно.

Кілька дрібних груп по одному фрагменту — протилежна проблема: сторінка, що постійно змінює тему, не дає пошуку нічого цілісного для цитування.

Фрагмент, який справді дістає питання

Питання до сторінки повертає фрагменти, які на нього відповідають, за рангом, і лише з цієї сторінки — це найближче до того, щоб побачити, як модель вирішує, для чого ваша сторінка. Якщо повернений фрагмент не той, який ви б вибрали, сторінка організована не так, як ви думаєте.

Це ще й найшвидший спосіб перевірити переписаний заголовок: змініть заголовок, прогоніть сторінку знову, задайте те саме питання.

Що таке семантичне розбиття на фрагменти?

Семантичне розбиття — це поділ сторінки на фрагменти по лініях, де змінюється її зміст, а не кожні N символів. Це крок між читанням сторінки та її ембедингом, і саме він вирішує, що модель зможе процитувати.

01

Розбиття фіксованої довжини

Розбиття фіксованої довжини ріже кожні N символів і є типовим у більшості конвеєрів, бо його тривіально написати. Воно ж ріже посередині речення, відділяє заголовок від відповіді під ним і робить фрагменти, які починаються з половини слова.

Воно швидке, дешеве й повторюване — і саме через нього стільки сторінок погано знаходяться за питаннями, на які відповідають ідеально.

02

Розбиття з урахуванням заголовків

Розбиття з урахуванням заголовків використовує власну структуру H2 і H3 сторінки як лінії розрізу, тож фрагмент приходить разом із заголовком, який його називає. Саме це Vectorscope робить першим, і для більшості сторінок це найбільше доступне покращення.

Це також означає, що текст ваших заголовків працює на пошук. Розділ «Огляд» не додає фрагменту нічого; розділ «Скільки це коштує?» додає саме питання.

03

Семантичне розбиття, і чого воно коштує

Семантичне розбиття порівнює сусідні блоки й ріже там, де зміст зсувається, що дає самодостатні фрагменти, але вимагає проходу ембедингом по сторінці до будь-якого пошуку. Через це чанкер може бути повільним — і через це результат того вартий.

Ніщо тут не позбавлене судження: розріз — це рішення про те, де закінчується одна думка. Vectorscope показує вам рішення, а не оцінку, бо оцінка їх би сховала.

Чи готовий мій контент до пошуку з ШІ?

Ця сторінка відповідає на це питання для одного URL за раз, чесно — а це означає називати те, чого вона не бачить, так само ясно, як те, що бачить.

Що цей інструмент може вам сказати

  • Яка частина вашої сторінки взагалі стає читабельним текстом — коефіцієнтом, а не прикметником.
  • Які саме фрагменти отримав би пошук, у порядку, з позначкою тих, що за межею.
  • Чи ваші фрагменти самодостатні, чи спираються на попередній, щоб мати сенс.
  • Який фрагмент дістає справжнє питання з вашої сторінки, за її власними ембедингами.
  • Чи сторінка сама просить не індексувати її — директива noindex повідомляється, а не ігнорується.

Чого він сказати не може

  • Чи має конкретний асистент вашу сторінку у своєму індексі. Цього не бачить ніхто поза тими компаніями.
  • Як модель ранжує вашу сторінку проти сторінки конкурента. Для цього потрібен корпус обох — а це продукт, не демо.
  • Чи вас цитують у відповіді сьогодні. Це вимір у часі за промтами, які ви вибрали, а не властивість однієї сторінки.

Як перевірити RAG-конвеєр за допомогою Vectorscope

Якщо ви будуєте пошук, а не контент, ця сторінка — референсна реалізація, яку можна навести на будь-який URL секунд за двадцять.

  1. 1Прогоніть сторінку, яку вже індексуєте, і порівняйте межі фрагментів зі своїм чанкером.
  2. 2Подивіться на коефіцієнт видобутку: якщо ваш нижчий на тому ж URL, ваш екстрактор викидає тіло тексту, а не обв’язку.
  3. 3Задайте сторінці питання, відповідь на яке знаєте, і перевірте, чи верхній фрагмент той, що її містить.
  4. 4Прогоніть завідомо задовгу сторінку. Фрагменти за межею — це ті, до яких ваш власний top-k теж не дійде.

Чанкер, модель ембедингів і межа тут — ті самі, що продукт запускає у продакшені. Демо на спрощеному конвеєрі лестило б тому конвеєру, який воно існує демонструвати.

Слова, вжиті на цій сторінці

Чотири терміни, визначені один раз, бо сторінка, яка вживає їх без визначення, — це сторінка, яку асистент нікому не пояснить.

Фрагмент (chunk)
Уривок сторінки, вирізаний так, щоб його можна було читати окремо. Системи пошуку зберігають і повертають фрагменти, а не цілі сторінки — тому структура сторінки важливіша за її довжину.
Ембединг
Список чисел, який стоїть за змістом уривка, так що два уривки про одне й те саме опиняються поруч. Порівняння ембедингів — це те, як пошук знаходить уривок без збігу слів.
Косинусна близькість
Міра того, наскільно два ембединги дивляться в один бік: 1 — тотожні, 0 — не пов’язані. Це число за кожним твердженням, що два уривки про одне й те саме.
RAG (пошук плюс генерація)
Відповідь на питання спершу пошуком уривків у джерелі, а вже потім написанням із них, а не з пам’яті моделі. Кожна відповідь ШІ, що цитує сторінку, зробила це — і сторінкою, яку вона процитувала, був фрагмент.
Видобуток (extraction)
Перетворення завантаженого HTML на читабельний текст, який отримує модель, з відкиданням навігації, скриптів і шаблону. Того, що видобуток викинув, жодна модель не побачить.

Питання, які про це ставлять

Як AI Mode вибирає, які джерела цитувати?

Ніхто поза Google не може назвати механізм, і ця сторінка не вдаватиме, що може. Спостережуване таке: цитовані сторінки зазвичай містять уривок, який відповідає на запит повністю й самотужки, а сторінки, чия відповідь розтягнута на кілька розділів, цитуються рідше, ніж заслуговує їхній зміст. Vectorscope показує, чи є такий уривок у вас.

Як потрапити в цитування AI Overviews?

Дайте відповіді власний уривок, під заголовком, який називає питання, достатньо високо на сторінці, щоб він пережив межу вибірки. Це не трюк — це форма, яку пошук винагороджує, і чи має її ваша сторінка, можна перевірити тут.

Це інструмент візуалізації ембедингів?

Так, для однієї сторінки за раз. Він ембедить кожен уривок URL і групує їх за змістом, тож видно, які частини сторінки поруч, а які стоять окремо. Він не малює корпус із тисяч документів.

Чим розбиття за заголовками відрізняється від семантичного?

Розбиття за заголовками ріже по власних заголовках сторінки; семантичне ріже там, де змінюється зміст, є там заголовок чи ні. Цей інструмент робить обидва, у цьому порядку — саме так має робити продакшен-конвеєр.

Ви зберігаєте сторінку, яку я перевіряю?

Прочитане тримається недовго, щоб ним можна було поділитися посиланням, а сама завантажена сторінка після формування звіту не зберігається. Акаунта немає, тож і прив’язати це ні до чого.

Це справді безкоштовно?

Так, з обмеженням частоти, а не з платною стіною. Обмеження існує, бо кожне читання коштує виклику ембедингів, і воно скидається у фіксованому вікні, про яке сторінка попереджає до того, як ви в нього впиретеся.

Читати далі

Довші відповіді на питання, які ця сторінка може лише підсумувати.

Чого це показати не може

Одна сторінка сама по собі. Чи відповідає вона на питання, які люди справді ставлять асистентам, як вона стоїть проти сторінки конкурента на ту саму тему, і для яких тем у вас сторінки немає взагалі — для цього потрібен корпус усього сайту, зміряний у часі.

Попросити запрошення