Всередині моделі нема кроку "перевірити факт". Є один процес: до вже наявного тексту додається найправдоподібніше продовження, слово за словом. Правдоподібність береться з закономірностей навчальних текстів. Коли закономірності збігаються з реальністю - відповідь точна. Коли збігу нема - модель все одно видає найправдоподібніше продовження, і воно виглядає як факт.
Тому "вигадка" - технічно той самий процес, що і правильна відповідь. Окремого режиму брехні нема. Це властивість усіх мовних моделей, незалежно від виробника і версії.
Гладкість тексту породжується механізмом генерації, і вона однакова для точної і вигаданої відповіді. Модель навчена писати впевнено, бо навчальні тексти написані впевнено. Питання "наскільки ти впевнена?" теж дає передбачений текст: цифра "впевнена на 95%" генерується тим самим процесом, що і сама відповідь.
Практичний висновок: сигналом якості служить не тон, а можливість перевірки - реквізити, цитати, посилання, які можна відкрити.
Ризик вигадки росте там, де в навчальних даних мало матеріалу або де потрібна точність до символу. Найнебезпечніші зони: точкові реквізити - номери справ, дати, суми, номери статей; рідкісні і вузькі теми, де текстів мало; події після межі навчання моделі; стик юрисдикцій і мов, де закономірності однієї країни підставляються в іншу.
Загальні механізми і поширені концепції модель відтворює надійно: про них у навчальних даних тисячі текстів. Що вужча і точніша річ, то більше перевірки вона потребує.
Додай документи в запит і напиши: "відповідай лише з цих документів; якщо відповіді в них нема - скажи прямо". Механіка проста: модель продовжує найсильніший наявний матеріал. Коли в контексті лежить твій документ, продовження будується з нього; без документа - з загальних закономірностей.
Дозвіл сказати "в документах цього нема" важливий окремо: без нього модель під тиском питання добудує відповідь із загальних місць.
Проси відповідь у формі, яку можна спростувати: "дай дослівну цитату і вкажи сторінку". Вигадана цитата з номером сторінки перевіряється за секунди - відкрив, подивився. Відповідь без прив'язки перевіряється хвилинами пошуку, тому її частіше приймають на віру.
Той самий принцип для практики і законодавства: реквізити рішення, номер статті, дата редакції. Реквізити переводять текст з "звучить правильно" у "можна відкрити і звірити".
Числа, номери справ, статті законів і дослівні цитати звіряються за першоджерелом завжди - незалежно від того, наскільки добре виглядає відповідь. Це дешева перевірка: реквізити вже є, відкрити документ - хвилина. Зустрічне питання "де саме це написано?" працює як швидкий фільтр: на реальний факт модель відповідає конкретним місцем, на вигаданий - часто перебудовує відповідь.
Увімкнений пошук знижує вигадки про свіжі події: модель читає знайдені сторінки замість згадувати. Правило першоджерела при цьому лишається: посилання, яке дав пошук, теж відкривається і читається. Перевірка другою моделлю не замінює першоджерело - моделі навчені на схожих даних і помиляються схоже.