Як звучить шаблон
Редактор каже, що чернетка звучить так, ніби її написала машина. Зазвичай вони праві щодо того, що почули, і помиляються щодо причин — тому ми створили інструмент, який підраховує текстуру замість вгадування автора, і потім виміряли його проти письма, яке не передбачалося виявляти.
Переклад з англійського оригіналу.
Коротка відповідь
- what
- Безкоштовний інструмент, який позначає повторювані форми речень, шаблонні фрази, уніфіковані початки та неперевірені твердження в тексті, причому за кожною позначкою стоїть правило.
- why
- Читачі реагують на текстуру, а не на авторство, а класифікатори авторства найчастіше помиляються з авторами, які пишуть іншою мовою, та у формальних реєстрах — де вартість переходить на автора.
- who
- Автори, які захищають правку, редактори, які пояснюють, що почули, і команди контенту, чії сторінки почали звучати однаково.
- where
- У публічному веб‑просторі за адресою getlooploop.com/patternscope, англійською, українською та іспанською, без реєстрації та без збереження даних.
- when
- Перед тим, як надіслати чернетку, або коли хтось сказав, що вона звучить машинно, і вам потрібно знати, що саме вони почули.
- how
- Детерміновані детектори — списки фраз, скелети речень і підрахунок слів — оцінюються як зважена щільність на тисячу слів, причому кожен пункт можна простежити до одного позначеного діапазону.
Просте пояснення
Іноді письмо здається нудним, навіть коли кожне речення правильне, бо ті самі форми постійно повторюються. Цей інструмент розфарбовує повторювані частини і вказує, яке правило їх виявило, щоб ви могли вирішити, чи змінювати їх. Він не вгадує, хто написав текст.
Редактор надсилає чернетку назад з одним рядком: це звучить так, ніби це написав ChatGPT. Автор справді написав її протягом двох днів. Тепер він мусить сперечатися про те, чого вони не можуть вказати. Ця суперечка стала причиною створення інструмента. Вона ж пояснює, чому інструмент відмовляється відповідати на найчастіше задаване питання.
Редактор зазвичай правий у тому, що почув. Він помиляється щодо причин. Те, на що він реагував, не є авторством. Це текстура. Однакова форма речення три рази. Чотири абзаци відкриваються однаково. Твердження без жодних даних у реченні для перевірки. Це піддається підрахунку. Хто саме набрав текст, не підлягає підрахунку.
Не запускайте детектор, який не може пояснити себе або чиї хибнопозитиви роблять оцінку менш корисною, ніж ручне читання.
наш власний план створення, написаний до того, як це існувало
Чому не AI‑детектор
Ми розглядали створення такого інструменту і відмовились від цього, з двох причин, які не пов’язані зі складністю.
Перша причина — де виникають помилки. Класифікатори, що вгадують авторство, найчастіше помиляються з авторами‑не‑носіями мови та у формальних реєстрах — це дві групи, які найменше можуть оскаржити рішення. Інструмент, який правильний у 95 % випадків, є інструментом, який впевнено помиляється в одному чернетці з двадцяти, і ці витрати лягають на автора, а не на нас.
Друга причина — рішення є марним, навіть коли воно правильне. An assistant wrote this не змінює чернетку перед вами. This sentence shape appears four times in nine hundred words, here are all four — це правка, яку можна зробити до обіду.
Чотири речі, які ми підраховуємо
Кожне знаходження — це фрагмент вашого тексту, поруч зазначено правило, яке його створило. Чотири групи, бо читач може тримати чотири:
- Stock phrasing — фраза, що займає місце, куди належить щось конкретне. It is worth noting that. In connection with the fact that.
- Repeated shape — два речення, зведені до одного скелету. Різні слова, одна конструкція.
- Uniform openings — три і більше речень підряд, які починаються однаково, подаються як одне знаходження, а не три.
- Unchecked claims — оцінковий прикметник перед абстрактним іменником у реченні, у якому немає нічого підлягаючого перевірці.
Остання умова робить його детектором, а не оцінкою стилю. A comprehensive solution — це твердження. A comprehensive solution that cut review time from nine days to two — це ті ж слова з доданим доказом, і друге не позначається.
skeletonOf("Our approach delivers a comprehensive solution")
→ "our · · art · ·"
skeletonOf("Our team delivers an individual approach")
→ "our · · art · ·"
// Different sentences. The same sentence. The skeleton is what says so —
// and the article/an distinction is dropped on purpose, because the surface
// form of an article is exactly the noise a skeleton exists to remove.Спробуйте на власній сторінці
Подивіться, що PatternScope знайде на вашій сторінці
Усе, що написано вище, можна зміряти на власній роботі, і перевірка займає близько хвилини. Вставте одну адресу і прочитайте, що повернеться.
Відкрити PatternScopeБезкоштовно · без акаунта · по одній за раз
Кожна точка веде до позначки
Число — це зважена щільність знахідок на тисячу слів — легка знахідка оцінюється 1, середня — 3, важка — 6 — і розбивка поруч з нею є саме число, а не діаграма поруч. Ви можете не погоджуватися з усією групою і відняти її самостійно. Відхилити одну знахідку — бал знижується саме на її очки.
Щільність на тисячу слів, бо чистий підрахунок винагороджує довжину: цільова сторінка у чотириста слів з шістьма шаблонними фразами щільніша, ніж звіт у чотири тисячі слів з п'ятнадцятьма, і підрахунок показує протилежне.
Одна звичка не може охопити все читання. Сторінка, створена за шаблоном, повторює одне речення сорок разів; лише перші чотири враховуються, інші тридцять шість позначаються як придушені. Усі сорок залишаються позначеними в тексті — обмеження стосується оцінювання, а не приховування.
Потім ми записали мітки, і мітки не збігалися
До цього моменту кожен поріг у інструменті перевірявся за допомогою речень, написаних для його спрацювання. Це тест коду, а не судження: звісно, детектор спрацьовує на реченні, створеному для цього.
Тому ми створили позначений набір — чотирнадцять документів трьома мовами та п’ять типів тексту: шаблонний маркетинг, добре відредагована проза, технічна документація, навмисна анафора та контракт, який навмисно уніфікований. Пороги асиметричні, і це навмисно. Для хорошої прозі толерантність дорівнює нулю: таке виявлення є хибнопозитивним, яке не можна спростувати. Recall вимірюється, але не обмежується 100 %, бо одна і та сама особа писала правила та мітки, і згода там — це згода з собою.
| Тип письма | Документи | Виявлення | Читання |
|---|---|---|---|
| Добре відредагована проза | 4 | 0 | чистий, як зазначено |
| Технічна документація | 3 | 0 | чистий, як зазначено |
| Навмисна анафора | 2 | 2 | позначено навмисно, відхилено одним натисканням |
| Юридичний, уніфікований за задумом | 1 | 1 | позначено навмисно, відхилено одним натисканням |
| Маркетинг за шаблоном | 4 | 30 | для чого існує інструмент |
Три недоліки, які жоден юніт‑тест не міг виявити
Двослівне вікно неправильне для половини мов, якими ми публікуємо
We deliver quality / We deliver speed спільно відкривають we deliver. Іспанська, що означає те саме — Ofrecemos calidad / Ofrecemos rapidez — опускає займенник, тому два слова виходять за межі дієслова до об’єкта, і це не було зафіксовано. Іспанська та українська — мови з пропуском займенника; англійська — ні; жодна константа не підходить для обох. Тепер вікно — одне змістове слово плюс функціональні слова перед ним: однакова кількість речень у кожній мові, а не однакова кількість слів.
Потолок був припущенням у вбранні вимірювання
Оцінка насичувалась на 12 зважених балів на тисячу слів, з коментарем, що за цим стоїть набір калібрування. Набору калібрування не було. При правильному вимірюванні чистий прозовий текст має 0, навмисний пристрій — між 34 і 83, а шаблонний маркетинг — між 205 і 472 — тому старий потолок був нижчим більш ніж на порядок величини, і шістдесят‑три‑словний контракт з однією навмисною повторювальною фразою отримав 100 з 100. Кожен короткий документ з одним суттєвим виявом насичував шкалу, створену для сторінки.
Тест, який не міг провалитися
Один фікстур містив 55 слів при мінімумі 60, тому інструмент правильно відмовився оцінювати його, і твердження про відхилення виявлення пройшло без запуску. Тест, який не може провалитися, гірший за відсутність тесту, бо він все одно враховується.
Зважені результати на 1 000 слів, виміряні за міченим набором
Три мови, три лексикони, без перекладів
Англійська, українська та іспанська — у кожної є свій список фраз, написаний носієм мови. Це не ретельність заради самої ретельності. У зв'язку з тим, що і in connection with the fact that — це два різні звички у двох різних мовах; список, перекладений з однієї, вимірює переклад, а не текст. Пороги також були визначені окремо для кожної мови, а не успадковані від англійської.
Французька та польська знаходяться в плані за однією умовою: кожна спочатку потребує власного позначеного набору — той самий рівень, який пройшли перші три.
Що воно ще не може сказати
Кожен документ у позначеному наборі містить від 60 до 300 слів, тому верхня межа шкали є екстраполяцією з одного постійного значення. Сторінка у 2000 слів із шаблонною фразою кожні сто слів сьогодні читається низько, і жодне з вимірюваних нами даних не доводить правильність цього. Довгі документи – наступний тип, який додається до набору, і вони, ймовірно, знову підвищать верхню межу.
Він також не може визначити, чи ваш аргумент правильний, чи порядок розділів неправильний, чи варто було писати цей матеріал. Чотири правила не охоплюють усі аспекти якісного письма, а оцінка 0 – це вимір, а не комплімент.
Питання, які задають люди
Чи є це детектором ШІ?
Ні, і він не стане таким. Він не оцінює, чи був текст написаний людиною чи моделлю, і не робить висновків про це. Він знаходить конкретні редакційні патерни і показує, де кожен з них розташований.
Чи означає високий бал, що текст поганий?
Ні. Щільність патернів — це редакційний сигнал, а не оцінка. Контракт є однорідним навмисно, і анафора повторюється навмисно, і обидва сприймаються як щільні. Число вказує, куди дивитися; чи це помилка — ваше рішення.
Що відбувається з текстом, який я вставляю?
Він аналізується в межах запиту і не зберігається. На нашій стороні немає копії, немає сторінки результату, яку треба виключати з пошуку, немає вікна зберігання, яке треба пояснювати. Жодна модель його не бачить: кожен детектор детермінований, саме тому один і той же текст завжди отримує однакове читання.
Чому бал обмежений?
Після досягнення межі число перестає розрізняти будь‑що — 340 і 700 на тисячу слів — це і проза, яку ніхто не хоче читати. Інструмент повідомляє, що читання досягло межі, а не вдає, що різниця щось означає.
Чи можу я не погодитися з виявом?
Так, і це один клік. Послідовність однакових відкриттів подається як одне виявлення, що охоплює весь пристрій, тому відхилення навмисної анафори не вимагає чотирьох кліків. Бал зменшується саме на те, що ви відхилили.
Які мови він аналізує?
Англійська, українська та іспанська, кожна зі своїм списком фраз і своїми порогами. Текст іншою мовою не аналізується, а не аналізується погано, і причина наведена у статті вище: детектор без власного лексикону повертає нуль для всього, і нуль сприймається як похвала.
Прочитайте самостійно
Вставте сторінку в PatternScope і подивіться, на що реагує читач. Він розташований поруч із трьома іншими безкоштовними читаннями на сторінці free tools, а словник у цій статті — AI slop, near-duplicate content, Goodhart's law — знаходиться у глосарі.
Останнє варто прочитати перед тим, як ви оптимізуєте це число. Міра, що стає ціллю, перестає вимірювати. Письменник, який редагує, щоб знизити оцінку, а не щоб бути зрозумілим, отримав неправильну інструкцію від інструмента, який лише мав вказувати.
Продукт
Стежте за кожною сторінкою щодня
Одне зчитування каже, де сторінка стоїть сьогодні. Продукт ставить ті самі питання тим самим асистентам постійно — тож про зміну вам повідомляють, а не ви йдете її шукати.
Попросити запрошенняЗа запрошеннями, поки ми тримаємо зчитування чесними
Автор
GetLoopLoop AIавтор
15+ років у маркетингу та SEO. Десятки продуктів, переважно американський ринок. Дослідження і заміри.
LinkedInPass it on
Read in your language
Opens a browser translation of this English article. The original source stays in English.