Przejdź do treści
Jarosław Jaśkowiak

J08 / AI, technologia, dane i RevOps

Baza wiedzy i treści sprzedażowe w B2B: źródła, wyszukiwanie kontekstu i aktualność

Jak projektować jedną dziedzinę wiedzy albo jeden przepływ pracy nad odpowiedziami przez IWS-1–IWS-10 i SWI-0–SWI-12: użytkownicy, pytania, zamierzone użycie, moc rozstrzygająca źródła, własność, prawa do treści, poufność, dostęp, wczytanie źródła, parsowanie, metadane, wersja, dzielenie na fragmenty, indeksowanie, wyszukiwanie leksykalne, wektorowe i hybrydowe, szeregowanie, kontrakt odpowiedzi, cytowanie, niepewność, powstrzymanie się, ocena jakości, pokrycie, sprzeczność, korekta, aktualność, wykrywanie zmian, incydent, wycofanie źródła, archiwizacja, usunięcie, przenoszalność i wygaszenie — bez fikcji jedynego źródła prawdy, bez podobieństwa traktowanego jako prawda i bez RAG jako substytutu mocy rozstrzygającej

Jarosław Jaśkowiakautor metodyki Nowoczesna Sprzedaż B2B

~42 min czytania

Handlowiec przygotowuje ofertę dla klienta strategicznego. Pyta wewnętrznego asystenta o maksymalny rabat, parametry produktu, obowiązującą gwarancję i wymagania dotyczące bezpieczeństwa. Odpowiedź pojawia się po kilku sekundach. Każdy akapit ma cytowanie. Interfejs pokazuje wysoki poziom dopasowania, a użytkownik widzi nazwy dokumentów przechowywanych w firmowej bazie wiedzy.

Mimo tego odpowiedź jest błędna. Cennik pochodzi z poprzedniego kwartału. Instrukcja techniczna dotyczy wycofanej konfiguracji. Fragment o gwarancji został pobrany z umowy innego segmentu. Dokument dotyczący bezpieczeństwa jest aktualny, lecz dostępny wyłącznie dla określonej grupy i nie powinien zostać ujawniony w tym przepływie pracy. Cytowanie do limitu rabatu wskazuje właściwy plik, ale nie daje oparcia zdaniu wygenerowanemu przez model. System nie „zmyślił” wszystkich informacji. Połączył kilka prawdziwych elementów w fałszywą odpowiedź.

To nie jest wyłącznie problem modelu językowego. Błąd mógł powstać wcześniej: przy wyborze dziedziny, przypisaniu mocy rozstrzygającej, ocenie praw do treści, parsowaniu tabeli, dzieleniu na fragmenty, wersjonowaniu, filtrowaniu dostępu, wyszukiwaniu kontekstu, ponownym szeregowaniu albo mapowaniu twierdzenia do cytowania. Mógł też powstać później, gdy nowa wersja dokumentu nie uruchomiła ponownego indeksowania, a wcześniejsza odpowiedź pozostała w ofercie, CRM i pamięci użytkownika.

Baza wiedzy jest użyteczna dopiero wtedy, gdy organizacja potrafi odróżnić źródło od twierdzenia, moc rozstrzygającą od popularności, prawo dostępu od prawa użycia, wyszukiwanie kontekstu od trafności, cytowanie od oparcia twierdzenia, aktualność od prawdziwości oraz usunięcie pliku od pełnego wycofania.

Model IWS-1–IWS-10 — Infrastruktura Wiedzy Sprzedażowej jest autorską syntezą zarządzania wiedzą, zarządzania dokumentacją, pochodzenia danych, metadanych, wyszukiwania informacji, oceny jakości RAG, ładu danych, bezpieczeństwa i architektury sprzedaży. Nie jest certyfikatem prawdy, modelem dojrzałości, opinią prawną ani instrukcją wdrożenia konkretnego produktu. Wynika z architektury całej metodyki, z założeń Obszaru J i z granic ustanowionych w J02, J06 oraz J07.12345

Artykuł nie zakłada, że odpowiedź musi powstać. ABSTAIN, NO ANSWER, SHOW CONFLICT, HUMAN REVIEW, HOLD i WITHDRAWN są pełnoprawnymi wynikami przepływu pracy nad wiedzą.

W skrócie

Najważniejsze w 90 sekund

  1. Zacznij od jednej dziedziny albo jednego przepływu pracy nad odpowiedziami. „Cała wiedza sprzedażowa” jest zbyt szeroka, ponieważ polityka cenowa, specyfikacja produktu, studium przypadku i wymaganie prawne mają inną moc rozstrzygającą, inne prawa do treści, inną aktualność i inny koszt błędu.
  2. Rozdziel źródło, twierdzenie, fragment, indeks, wynik wyszukiwania i odpowiedź. To osobne obiekty z własną wersją, właścicielem i historią.
  3. Moc rozstrzygająca nie jest popularnością ani jedną punktacją. Zatwierdzona polityka może rozstrzygać o rabacie, ale nie o interpretacji prawa.
  4. Dostęp nie oznacza prawa użycia. Publiczny URL, subskrypcja albo techniczne uprawnienie nie przesądzają o kopiowaniu, indeksowaniu, transformacji i publikacji.6789
  5. Wczytanie źródła nie jest przeglądem. Parser może utracić tabelę, przypis, wyjątek albo datę obowiązywania, nawet gdy technicznie zakończy zadanie.
  6. Metadane są częścią kontroli. Identyfikator źródła, wydawca, właściciel, wersja, data obowiązywania, prawa do treści, wskazanie miejsca i suma kontrolna umożliwiają odtworzenie odpowiedzi.101112
  7. Wyszukiwanie kontekstu wymaga lokalnego testu. Wyszukiwanie leksykalne, wektorowe i hybrydowe, filtry metadanych, filtry uprawnień i ponowne szeregowanie należy porównać na rzeczywistym zestawie pytań.1314
  8. Podobieństwo embeddingów nie jest trafnością. Dokument podobny językowo może dotyczyć innej jurysdykcji, wersji, produktu albo populacji.
  9. RAG nie eliminuje twierdzeń bez oparcia w źródle. Model może źle użyć poprawnego kontekstu, pominąć relewantne dowody albo dołączyć cytowanie, które nie wspiera twierdzenia.151617
  10. Odpowiedź musi umieć odmówić. Brak pokrycia, sprzeczność, brak praw do treści albo użycie o wysokiej stawce mogą wymagać powstrzymania się i przeglądu specjalistycznego.
  11. Aktualność nie jest datą wczytania źródła. Potrzebne są data obowiązywania, wygaśnięcie, rytm przeglądu, wykrywanie zmian i historyczny snapshot.
  12. Wycofanie obejmuje więcej niż plik. Trzeba znaleźć fragmenty, indeksy, embeddingi, pamięć podręczną, odpowiedzi, materiały i decyzje w dole strumienia.

Rozłożone na 24 sekcji

Baza wiedzy, źródło, twierdzenie, rekord i odpowiedź — definicje

W praktyce słowo „wiedza” bywa używane dla wszystkiego: PDF-u, notatki ze spotkania, instrukcji, wyniku wyszukiwania, streszczenia modelu i decyzji managera. J08 rozdziela te obiekty.

Źródło to kontrolowany zasób, na przykład akt prawny, umowa, polityka, dokumentacja produktu, badanie, rekord CRM albo zatwierdzona notatka. Źródło ma tożsamość, wydawcę, właściciela, wersję, daty, prawa do treści, zakres i wskazanie miejsca.

Twierdzenie to zdanie, które może zostać ocenione jako wspierane, niewspierane, sprzeczne, aktualne albo nieaktualne. Jeden dokument zawiera wiele twierdzeń. Jedno twierdzenie może wymagać wielu źródeł.

Rekord to wersjonowany zapis decyzji i stanu. Rekord źródła nie jest samym dokumentem. Przechowuje metadane, moc rozstrzygającą, uprawnienia, sumy kontrolne, statusy, przeglądy i cykl życia. Zasady zarządzania dokumentacją podkreślają potrzebę tworzenia, przejęcia, metadanych, odpowiedzialności i kontroli przez cały cykl życia.18

Fragment to wydzielona część źródła utworzona dla indeksu lub kontekstu. Nie dziedziczy automatycznie pełnego znaczenia dokumentu. Musi prowadzić do dokładnej wersji źródła, ścieżki nagłówków, strony lub sekcji i etykiety dostępu.

Indeks to mechanizm odnajdywania kandydatów. Nie jest zbiorem zatwierdzonych prawd. Może zawierać wersje aktywne, ograniczone, historyczne albo przypadkowo nieaktualne, jeżeli cykl życia jest wadliwy.

Wynik wyszukiwania to kandydat wybrany metodą leksykalną, wektorową, hybrydową albo przez ponowne szeregowanie. Jest propozycją dowodu, nie werdyktem.

Odpowiedź to wynik skierowany do użytkownika. Może być wyciągiem ze źródła, syntezą, wersją roboczą, komunikatem o sprzeczności albo odmową. Każde materialne twierdzenie odpowiedzi powinno mieć własne oparcie w źródle i ograniczenie.

Standardy pochodzenia danych, takie jak W3C PROV, pomagają opisać relacje między encjami, działaniami i agentami, ale nie ustalają, które źródło rozstrzyga o konkretnej decyzji.19 J08 łączy pochodzenie danych z własnością biznesową, prawami do treści, aktualnością i korektą.

Dlaczego „single source of truth” jest niebezpiecznym skrótem

Hasło single source of truth ma sens jako postulat ograniczania niekontrolowanych kopii i sprzecznych definicji. Staje się jednak ryzykowne, gdy sugeruje, że jeden system, plik albo indeks ma niekwestionowaną moc rozstrzygającą dla wszystkich pytań.

Organizacja może potrzebować równolegle:

  • aktualnej polityki cenowej dla dzisiejszej oferty;
  • historycznej polityki dla odtworzenia decyzji sprzed sześciu miesięcy;
  • podpisanej umowy jako źródła rozstrzygającego dla konkretnego klienta;
  • dokumentacji produktu dla wersji faktycznie wdrożonej;
  • oficjalnego aktu i wytycznych dla pytania prawnego;
  • badania pierwotnego dla twierdzenia empirycznego;
  • kontrolowanego rekordu operacyjnego dla stanu konkretnego procesu.

Te źródła mogą być prawidłowe jednocześnie, lecz odpowiadać na inne pytania. Jeden indeks nie usuwa różnicy między mocą rozstrzygającą, trafnością i czasem obowiązywania. DCAT 3 wspiera interoperacyjny opis katalogów, zbiorów danych, dystrybucji, wersji i serii, ale sam katalog nie ocenia prawdziwości ani przydatności do celu.10 Data Quality Vocabulary pozwala opisać pomiary jakości i informacje o jakości, lecz nie daje uniwersalnego progu „prawdy”.20

Bezpieczniejsza zasada brzmi:

JEDEN KONTROLOWANY ZBIÓR ŹRÓDEŁ
DLA
JEDNEJ OKREŚLONEJ DZIEDZINY ALBO JEDNEGO PRZEPŁYWU PRACY NAD ODPOWIEDZIAMI
Z
JAWNĄ MOCĄ ROZSTRZYGAJĄCĄ, PRAWAMI, WERSJĄ, AKTUALNOŚCIĄ I OGRANICZENIAMI

W takim systemie źródło może mieć status VERIFIED_IN_SCOPE, ACTIVE, CONFLICTING, STALE, RESTRICTED, HOLD, SUPERSEDED, WITHDRAWN albo ARCHIVED. Nie wszystkie materiały muszą zostać sprowadzone do jednego zwycięzcy. Czasem najuczciwszą odpowiedzią jest pokazanie konfliktu, wskazanie zakresów obowiązywania i przekazanie pytania do właściwego właściciela.

Obiekt kontrolowany J08

J08 projektuje jeden z dwóch obiektów:

  1. dziedzina wiedzy — kontrolowany wycinek wiedzy, na przykład polityka cenowa dla określonego regionu;
  2. przepływ pracy nad odpowiedziami — kontrolowany przebieg od pytania do odpowiedzi, przeglądu i użycia, na przykład odpowiedź na ankietę bezpieczeństwa.

Minimalny zakres obejmuje:

UŻYTKOWNIK+ZESTAW PYTAŃ+ZAMIERZONE UŻYCIE+GRANICA DECYZJI+GRANICA DZIAŁANIA+OSOBY DOTKNIĘTE SKUTKAMI+KLASY ŹRÓDEŁ+KOSZT BŁĘDU+JĘZYK, JURYSDYKCJA I CZAS

Ten sam dokument może należeć do wielu dziedzin, ale z innymi zasadami. Studium przypadku może być aktywne jako dowód marketingowy i niedopuszczalne jako podstawa gwarancji technicznej. Notatka ze spotkania może wspierać przygotowanie follow-upu, ale nie być dozwolona do formalnej oceny pracownika. Aktualny cennik może służyć do kalkulacji, lecz nie zastępuje mandatu do zaakceptowania niestandardowego rabatu.

Obiekt kontrolowany określa również wyłączenia. Przykładowo dziedzina „specyfikacje produktu” może nie obejmować:

  • interpretacji prawnej;
  • zobowiązań niestandardowych;
  • produktów wycofanych;
  • danych innych klientów;
  • źródeł bez zatwierdzonych praw;
  • pytań wymagających diagnozy specjalistycznej.

Takie ograniczenie nie jest słabością bazy. Jest warunkiem testowania pokrycia, wyszukiwania kontekstu i jakości odpowiedzi. Bez jawnego zestawu pytań nie wiadomo, czy brak odpowiedzi jest błędem, czy prawidłowym powstrzymaniem się.

J08 zachowuje granice innych modułów: architektura technologii sprzedaży definiuje systemy i integracje, CRM jako system decyzji kontroluje rekordy operacyjne, a AI w pracy handlowca projektuje jeden przypadek użycia korzystający ze źródeł.

IWS-1–IWS-10 — mapa całego systemu

Model nie jest lejkiem, w którym każdy dokument musi dojść do statusu ACTIVE. Jest pętlą z dozwolonymi ścieżkami powrotu, wstrzymania, powstrzymania się, korekty i wycofania.

IWS-1  DZIEDZINA, UŻYTKOWNICY, PYTANIA I ZAMIERZONE UŻYCIE
IWS-2  KLASY ŹRÓDEŁ, MOC ROZSTRZYGAJĄCA I WŁASNOŚĆ
IWS-3  PRAWA DO TREŚCI, POUFNOŚĆ, DOSTĘP I UPRAWNIENIA
IWS-4  WCZYTANIE ŹRÓDŁA, PARSOWANIE, METADANE I WERSJA
IWS-5  DZIELENIE NA FRAGMENTY, INDEKSOWANIE, WYSZUKIWANIE I SZEREGOWANIE
IWS-6  KONTRAKT ODPOWIEDZI, CYTOWANIE, NIEPEWNOŚĆ I POWSTRZYMANIE SIĘ
IWS-7  OCENA JAKOŚCI, POKRYCIE, SPRZECZNOŚCI I KOREKTA
IWS-8  AKTUALNOŚĆ, WYGAŚNIĘCIE, WYKRYWANIE ZMIAN I PRZEGLĄD
IWS-9  INFORMACJA ZWROTNA, INCYDENT, WYCOFANIE ŹRÓDŁA I PROPAGACJA
IWS-10 ARCHIWIZACJA, USUNIĘCIE, PRZENOSZALNOŚĆ I WYGASZENIE

Główna taksonomia SWI-0–SWI-12 opisuje status źródła lub wiedzy:

  • UNKNOWN
  • CANDIDATE_SOURCE
  • RIGHTS_PENDING
  • INGESTED_UNREVIEWED
  • VERIFIED_IN_SCOPE
  • ACTIVE
  • CONFLICTING
  • STALE
  • RESTRICTED
  • HOLD
  • SUPERSEDED
  • WITHDRAWN
  • ARCHIVED

Statusy nie są drabiną dojrzałości. CONFLICTING może być bardziej uczciwy niż ACTIVE; RESTRICTED może być konieczny dla poufnego źródła; WITHDRAWN jest prawidłowym wynikiem po wygaśnięciu licencji. Norma zarządzania wiedzą ISO 30401 podkreśla ustanawianie, wdrażanie, utrzymywanie, przegląd i doskonalenie systemu, ale nie dostarcza architektury RAG ani automatycznego zatwierdzania źródeł.21 Przed zastosowaniem tego materiału należy ponownie sprawdzić status rozwijanego nowego wydania ISO 30401.

IWS-1 — dziedzina, użytkownicy, pytania i zamierzone użycie

IWS-1 zaczyna od pytania: kto ma uzyskać jaką odpowiedź, do jakiej decyzji i z jakim kosztem błędu?

Przykład „baza wiedzy produktowej” jest niewystarczający. Potrzebny jest zapis:

domain: "Parametry techniczne linii X dla rynku UE"
users:
  - "inżynier sprzedaży"
  - "account manager"
questions:
  - "Jakie są zatwierdzone parametry konfiguracji A?"
  - "Jakie ograniczenia środowiskowe obowiązują?"
intended_use:
  - "przygotowanie roboczej wersji odpowiedzi technicznej"
excluded_use:
  - "interpretacja prawna"
  - "autonomiczne zobowiązanie wobec klienta"
decision_boundary:
  - "wybór zatwierdzonej konfiguracji"
action_boundary:
  - "wysłanie odpowiedzi dopiero po przeglądzie"
failure_cost:
  - "wysoki przy niezgodnej specyfikacji"

Zestaw pytań powinien obejmować pytania typowe, rzadkie, negatywne, niejednoznaczne i poza zakresem. Bez nich zespół testuje jedynie kilka demonstracyjnych promptów, które nie reprezentują realnego użycia.

IWS-1 identyfikuje osoby dotknięte skutkami. Odpowiedź może wpływać na klienta, inżyniera, partnera, pracownika, kandydata albo osobę, której dane znajdują się w źródle. Zmienia to wymagania dotyczące dostępu, przejrzystości, przeglądu i środków naprawczych.

Zakres powinien być rozdzielony, gdy łączy różne modele mocy rozstrzygającej. Polityka cenowa, studia przypadków i wymagania prawne nie powinny tworzyć jednej dziedziny tylko dlatego, że korzysta z nich sprzedaż. Każde z nich ma inną definicję aktualności i inny warunek zatrzymania.

Przejście z artykułu o podziale pracy człowiek–technologia jest bezpośrednie: Matryca Podziału Pracy Człowiek–Technologia określa, czy użytkownik potrzebuje tylko dostępu do wiedzy, wersji roboczej, wsparcia decyzji czy osądu wyłącznie ludzkiego. J08 dostarcza kontrolowany ślad źródłowy dla wybranego trybu.

IWS-2 — klasy źródeł, moc rozstrzygająca i własność

Moc rozstrzygająca odpowiada na pytanie: dlaczego to źródło może wspierać to konkretne twierdzenie? Nie jest ogólną oceną wartości dokumentu.

Przykładowe klasy obejmują:

  • wiążący akt prawny;
  • oficjalne wytyczne;
  • umowę i zaakceptowane zobowiązanie;
  • zatwierdzoną politykę wewnętrzną;
  • zatwierdzoną dokumentację produktu;
  • badanie pierwotne;
  • standard techniczny;
  • kontrolowany rekord operacyjny;
  • materiał ekspercki;
  • dokumentację dostawcy;
  • dowód praktyczny;
  • opracowanie wtórne;
  • treść tworzoną przez użytkowników.

Hierarchia nie jest stała. Umowa konkretnego klienta może mieć większą moc rozstrzygającą dla jego warunków niż ogólna polityka. Zatwierdzona instrukcja może być ważniejsza niż nowszy blog dostawcy. Tekst aktu prawnego i oficjalne wytyczne pełnią inne funkcje: wytyczne mogą wyjaśniać stosowanie, ale nie zastępują wiążącego tekstu. AI Act oraz inne regulacje wymagają interpretacji konkretnego przypadku użycia i nie powinny być automatycznie klasyfikowane przez bazę wiedzy.22

Każde źródło potrzebuje przynajmniej dwóch ról:

  • właściciela źródła, który odpowiada za tożsamość, wersję, zakres i cykl życia;
  • właściciela wiedzy, który odpowiada za dziedzinę, zestaw pytań, kontrakt odpowiedzi i jakość.

Administrator techniczny nie staje się przez to właścicielem merytorycznym. Podobnie autor dokumentu nie musi mieć mandatu do zatwierdzenia sposobu użycia.

Przy konflikcie należy zapisać:

TWIERDZENIE+MOC ROZSTRZYGAJĄCA I CZAS OBOWIĄZYWANIA ŹRÓDŁA A+MOC ROZSTRZYGAJĄCA I CZAS OBOWIĄZYWANIA ŹRÓDŁA B+RODZAJ SPRZECZNOŚCI+WŁAŚCICIEL+REGUŁA ODPOWIEDZI TYMCZASOWEJ+ROZSTRZYGNIĘCIE ALBO POWSTRZYMANIE SIĘ

System nie powinien usuwać sprzeczności przez wybór dokumentu z największą liczbą odwołań albo najwyższą punktacją podobieństwa. Źródło o statusie CONFLICTING pozostaje widoczne do czasu rozstrzygnięcia lub trwałego oznaczenia zakresów.

IWS-3 — prawa do treści, poufność, dostęp i uprawnienia

Pytanie „czy użytkownik może otworzyć dokument?” jest węższe niż „czy organizacja może go skopiować, sparsować, zindeksować, przetworzyć przez zewnętrzny model, zachować embeddingi i wykorzystać w odpowiedzi?”.

Rekord powinien rozdzielać:

  • własność;
  • licencję;
  • domenę publiczną albo otwartą licencję;
  • dostęp wynikający z umowy;
  • poufność;
  • dane osobowe;
  • tajemnicę przedsiębiorstwa;
  • prawo do bazy danych;
  • ograniczenie celu;
  • ograniczenia ekstrakcji, przekształcania, retencji i publikacji;
  • prawo do usunięcia lub wycofania.

Dyrektywa DSM reguluje prawo autorskie i określone wyjątki, w tym eksplorację tekstów i danych, lecz ich warunki i krajowa implementacja muszą zostać sprawdzone dla konkretnego działania.7 Odrębna dyrektywa chroni bazy danych; prawa do kolekcji i prawa do poszczególnych elementów nie są tym samym.8 Dyrektywa o ochronie tajemnic przedsiębiorstwa chroni poufne know-how i informacje biznesowe pod określonymi warunkami.9 RODO wprowadza ograniczenie celu, minimalizację danych, prawidłowość, ograniczenie przechowywania, bezpieczeństwo i prawa osób dla danych osobowych.6 Data Act tworzy określone prawa i obowiązki dostępu oraz użycia danych, ale nie daje ogólnej zgody na dowolne treści.23

Praktyczna decyzja może brzmieć:

DOSTĘP:
dozwolony dla wskazanych ról

WCZYTANIE ŹRÓDŁA:
dozwolone wyłącznie w prywatnej instancji

PRZETWARZANIE PRZEZ MODEL:
przetwarzanie zewnętrzne zabronione

PONOWNE UŻYCIE:
wyłącznie wewnętrzny przepływ pracy nad odpowiedziami

PUBLIKACJA:
zabroniona

RETENCJA:
12 miesięcy z przeglądem

WYCOFANIE:
obowiązkowe przy wygaśnięciu licencji

RIGHTS_PENDING nie powinno domyślnie przechodzić do wczytania źródła. Jeżeli organizacja musi zachować rekord o kandydacie, może przechowywać minimalne metadane bez kopiowania pełnej treści.

Wyszukiwanie respektujące uprawnienia wymaga, aby filtr uprawnień działał przed ujawnieniem fragmentu i przed generowaniem odpowiedzi. Ukrycie linku po wygenerowaniu tekstu nie naprawia wycieku treści.

IWS-4 — wczytanie źródła, parsowanie, metadane i wersja

Wczytanie źródła jest serią kontrolowanych przekształceń, a nie operacją „plik został wgrany”.

Minimalny przebieg:

ZAREJESTRUJ ŹRÓDŁO
→ USTAL TOŻSAMOŚĆ
→ ZAPISZ WERSJĘ I DATY
→ ZAPISZ PRAWA I DOSTĘP
→ POBIERZ SUMĘ KONTROLNĄ
→ SPARSUJ
→ ZWALIDUJ STRUKTURĘ
→ UTWÓRZ FRAGMENTY
→ DOŁĄCZ ŚCIEŻKĘ POCHODZENIA
→ ZAINDEKSUJ
→ PRZETESTUJ

Metadane powinny obejmować co najmniej identyfikator źródła, tytuł, wydawcę, autora, właściciela, klasę mocy rozstrzygającej, kanoniczne wskazanie miejsca, prawa do treści, poufność, datę publikacji, daty obowiązywania, datę przeglądu, wygaśnięcie, wersję i sumę kontrolną. DCMI Metadata Terms oraz DCAT dostarczają interoperacyjnych słowników, lecz lokalny kontrakt musi uwzględnić pola specyficzne dla decyzji sprzedażowej.1011

Parser może utracić:

  • nagłówki i hierarchię;
  • kolumny tabeli;
  • jednostki;
  • przypisy;
  • listy wyjątków;
  • relacje między obrazem a opisem;
  • zarejestrowane zmiany;
  • status podpisu;
  • datę obowiązywania;
  • zakres obowiązywania.

Stan PARSED nie jest równoznaczny z STRUCTURE_PRESERVED. Dla tabel technicznych albo umów trzeba testować materialne elementy ręcznie lub za pomocą reguł domenowych. SHACL może wspierać walidację ograniczeń dla grafów metadanych, ale nie sprawdzi, czy z tabeli zniknęło zastrzeżenie zmieniające znaczenie.24

Wersjonowanie powinno odróżniać:

data publikacji
obowiązuje od
obowiązuje do
czas wczytania
czas indeksowania
data przeglądu
termin ważności
zastąpione przez

Nowa data modyfikacji pliku nie zawsze oznacza nową treść. Z drugiej strony identyczna nazwa pliku nie dowodzi identyczności; dlatego przydatne są suma kontrolna i historia przekształceń.

Jak zachować ścieżkę pochodzenia źródło–fragment–indeks

Ścieżka pochodzenia danych umożliwia odpowiedź na pytania:

  • z którego dokładnie pliku i wersji pochodzi fragment;
  • jaki parser i jaka polityka dzielenia na fragmenty go utworzyły;
  • w jakim indeksie został zapisany;
  • które zapytania go pobrały;
  • jakie twierdzenia odpowiedzi na nim oparto;
  • gdzie odpowiedź została wykorzystana;
  • co trzeba przejrzeć po korekcie lub wycofaniu.

W3C PROV opisuje pochodzenie danych przez encje, działania i agentów.19 OpenLineage używa pojęć dataset, job, run i event oraz rozszerzalnych facets, co pokazuje praktyczną wartość zdarzeniowego śladu przekształceń.25 Web Annotation Data Model może wspierać selectors i targets potrzebne do wskazania dokładnego fragmentu.26

Przykładowy łańcuch:

source_id: "SRC-PRICE-PL-2026-Q3"
source_version: "3.1"
source_checksum: "..."
ingestion_run: "ING-2026-07-04-01"
parser: "parser-x@2.4"
chunk_id: "CHK-0042"
locator:
  heading: "Rabaty niestandardowe"
  page: 17
index_id: "IDX-PRICING-EU-V5"
query_id: "Q-991"
answer_id: "A-335"
claim_id: "CL-2"
downstream:
  - "draft-offer-781"

Bez takiego łańcucha wycofanie jest zgadywaniem. Usunięcie SRC-PRICE-PL-2026-Q3 z folderu nie mówi, czy jego fragmenty pozostały w indeksie, pamięci podręcznej, dziennikach, odpowiedziach lub ofertach.

Ścieżka pochodzenia danych nie musi oznaczać przechowywania całej treści w każdym dzienniku. Powinna zachować wystarczające identyfikatory, wersje i zdarzenia, aby odtworzyć przepływ z poszanowaniem minimalizacji danych i uprawnień dostępu. Obiekty historyczne mogą być objęte ograniczeniami lub zarchiwizowane, ale nie powinny być bez śladu nadpisywane.

IWS-5 — dzielenie na fragmenty, indeksowanie, wyszukiwanie i szeregowanie

Wyszukiwanie kontekstu powinno być zaprojektowane jako sekwencja jawnych decyzji:

ZAKRES ZAPYTANIA
→ NORMALIZACJA ALBO PRZEPISANIE ZAPYTANIA
→ KANDYDACI LEKSYKALNI
→ KANDYDACI WEKTOROWI
→ FILTRY METADANYCH
→ FILTRY UPRAWNIEŃ
→ DEDUPLIKACJA
→ PONOWNE SZEREGOWANIE
→ WYSTARCZAJĄCE DOWODY
→ ZŁOŻENIE KONTEKSTU ALBO POWSTRZYMANIE SIĘ

Wyszukiwanie leksykalne dobrze wykorzystuje dokładne terminy, numery modeli, klauzule i identyfikatory. Wyszukiwanie wektorowe może odnajdywać semantycznie podobne fragmenty, gdy użytkownik używa innego słownictwa. DPR pokazało potencjał wyszukiwania wektorowego w open-domain QA, lecz wyniki dotyczą określonych zbiorów danych i nie uzasadniają samego wyszukiwania wektorowego dla każdej dziedziny.13 BEIR wykazał zróżnicowaną skuteczność metod w wielu zadaniach i znaczenie mocnych linii bazowych, w tym BM25 i ponownego szeregowania.14

Wyszukiwanie hybrydowe powinno być hipotezą, nie marketingową etykietą. Lokalny test może wykazać, że:

  • BM25 najlepiej odnajduje numery produktów;
  • wyszukiwanie wektorowe pomaga przy pytaniach opisowych;
  • filtry metadanych są krytyczne dla jurysdykcji;
  • ponowne szeregowanie poprawia pierwszą piątkę wyników, ale obniża kompletność wyników dla wyjątków;
  • przepisanie zapytania usuwa ważny termin;
  • top-k=10 zwiększa szum w kontekście;
  • stałe top-k jest niewłaściwe dla pytań o różnej złożoności.

Self-RAG jest przykładem podejścia badawczego z adaptacyjnym wyszukiwaniem i autorefleksją, co podważa założenie, że system zawsze powinien pobrać stałą liczbę fragmentów.27 Nie oznacza to jednak, że autorefleksja gwarantuje poprawność.

Kontrakt wyszukiwania powinien przechowywać wersję modelu embeddingowego, ustawienia indeksu, filtry, model ponownego szeregowania, zestaw pytań, datę oceny i testy niezaliczone. Zmiana któregokolwiek elementu może unieważnić wcześniejsze dowody.

Dlaczego podobieństwo embeddingów nie oznacza trafności

Podobieństwo mierzy zbieżność reprezentacji w określonej przestrzeni. Trafność jest relacją między pytaniem, użytkownikiem, zamierzonym użyciem, dziedziną, czasem, jurysdykcją, mocą rozstrzygającą i skutkiem.

Dokument może mieć wysokie podobieństwo, ponieważ używa tych samych słów, lecz być nieistotny, gdy:

  • dotyczy innego produktu;
  • opisuje poprzednią wersję;
  • obowiązuje w innym kraju;
  • odnosi się do innego segmentu klienta;
  • jest materiałem marketingowym zamiast specyfikacji;
  • opisuje historyczny stan;
  • jest objęty ograniczeniami;
  • zawiera przykład zamiast reguły;
  • jest sprzeczny z umową;
  • pochodzi ze źródła bez mocy rozstrzygającej dla tego twierdzenia.

Dlatego wynik wyszukiwania powinien być opisywany przez wiele pól:

ranga leksykalna
ranga wektorowa
wynik ponownego szeregowania
dopasowanie metadanych
dopasowanie uprawnień
moc rozstrzygająca źródła
status źródła
dopasowanie czasu obowiązywania
znana sprzeczność
etykieta trafności nadana przez człowieka

Nie należy sumować ich do truth_score. Punktacja używana do kolejności kandydatów nie jest probabilistycznym dowodem prawdziwości. Podobnie wysoka kompletność wyników nie oznacza, że odpowiedź jest poprawna; system może pobrać wszystkie relewantne fragmenty i źle je zsyntetyzować.

Lokalny zestaw testowy powinien zawierać trudne przypadki negatywne: dokumenty podobne językowo, ale błędne co do wersji, jurysdykcji lub mocy rozstrzygającej. Powinien też obejmować przypadki, w których prawidłowym wynikiem jest brak wyników wyszukiwania.

RTR-7 RELEVANT_IN_SCOPE powinno wynikać z testów i reguł, nie z samego progu podobieństwa kosinusowego. Jeżeli system nie ma wystarczających dowodów, powinien przejść do RTR-13 RETRIEVAL_ABSTAIN.

Dzielenie na fragmenty, długi kontekst i utrata znaczenia

Dzielenie na fragmenty decyduje, co staje się jednostką wyszukiwania. Zbyt mały fragment może utracić definicję, wyjątek lub warunek. Zbyt duży może rozmyć trafność, zwiększyć koszt i utrudnić modelowi wykorzystanie właściwego miejsca w źródle.

Nie istnieje jedna uniwersalna liczba tokenów. Polityka powinna zależeć od struktury:

  • umowy — klauzula wraz z definicjami i wyjątkami;
  • specyfikacja — tabela z nagłówkami, jednostkami i przypisami;
  • polityka — sekcja wraz z zakresem i mocą rozstrzygającą;
  • FAQ — pytanie z pełną odpowiedzią;
  • badanie — twierdzenie z metodą i ograniczeniem;
  • rekord CRM — pola kontrolowane i czas zdarzenia;
  • instrukcja — procedura wraz z warunkiem wstępnym i ostrzeżeniem.

Badanie „Lost in the Middle” pokazało, że modele mogą gorzej wykorzystywać relewantne informacje umieszczone w środku długiego kontekstu.28 Wynik nie powinien być mechanicznie generalizowany na każdy nowy model, ale uzasadnia testowanie pozycji i długości kontekstu zamiast założenia „większe okno rozwiąże problem”.

Zapis fragmentu powinien przechowywać ścieżkę nagłówków, stronę lub sekcję, zakres tekstu, język, etykietę dostępu i sumę kontrolną. Tabela może wymagać reprezentacji strukturalnej zamiast liniowego tekstu. Obraz lub diagram może wymagać długiego opisu i odrębnego dowodu.

Dzielenie na fragmenty powinno być wersjonowane. Zmiana polityki może zmienić wyniki wyszukiwania nawet bez zmiany dokumentu. Wtedy należy wykonać ponowne wczytanie, ponowne indeksowanie i ponowny test. Stare fragmenty nie mogą pozostać aktywne razem z nowymi bez kontroli duplikatów i wersji.

Wyszukiwanie respektujące uprawnienia

Kontrola dostępu musi działać na każdym etapie, na którym treść może zostać ujawniona:

REJESTRACJA ŹRÓDŁA
→ WCZYTANIE ŹRÓDŁA
→ PRZYNALEŻNOŚĆ DO INDEKSU
→ WYSZUKANIE KANDYDATÓW
→ PONOWNE SZEREGOWANIE
→ ZŁOŻENIE KONTEKSTU
→ WYGENEROWANIE ODPOWIEDZI
→ POWIĄZANIE CYTOWANIA
→ EKSPORT I LOGOWANIE

Najbezpieczniejszy wzorzec to filtrowanie kandydatów według uprawnień przed przekazaniem ich do modelu. Model nie powinien otrzymać treści, której użytkownik nie może zobaczyć, nawet jeżeli interfejs później ukryje cytowanie.

Model dostępu może zależeć od:

  • roli;
  • klienta lub konta;
  • regionu;
  • projektu;
  • poziomu poufności;
  • zamierzonego użycia;
  • czasu;
  • umowy;
  • statusu zatrudnienia;
  • zasady wiedzy koniecznej.

Należy również kontrolować dzienniki zapytań i odpowiedzi. Pytanie może zawierać dane klienta, tajemnicę przedsiębiorstwa albo dane osobowe. Telemetria potrzebna do poprawy jakości nie daje automatycznego prawa do monitorowania poszczególnych osób ani do użycia kadrowego.

Bezpieczeństwo obejmuje także źródła jako granicę zaufania. NIST GenAI Profile wskazuje potrzebę zarządzania ryzykami informacji, pochodzenia danych, testowania i monitorowania.29 OWASP Top 10 dla aplikacji LLM/GenAI obejmuje między innymi wstrzyknięcie promptu, ujawnienie informacji wrażliwych, zatrucie danych i modelu, słabości baz wektorowych i embeddingów oraz niewłaściwą obsługę wyniku.30 NIS2 może nakładać dodatkowe obowiązki na podmioty objęte jej zakresem, ale wymaga to odrębnej analizy jurysdykcji i implementacji.31

Incydent uprawnień jest materialny nawet wtedy, gdy odpowiedź była merytorycznie poprawna. „Poprawnie, ale bez uprawnienia” nie jest wynikiem akceptowalnym.

IWS-6 — kontrakt odpowiedzi, cytowanie, niepewność i powstrzymanie się

Kontrakt odpowiedzi określa, co system może powiedzieć i w jakiej formie. Minimalne typy:

  • EXTRACTIVE_ANSWER — odpowiedź ograniczona do jawnie wskazanego fragmentu;
  • SYNTHESIZED_ANSWER — synteza wielu źródeł z rozdzieleniem twierdzeń;
  • DRAFT_ONLY — wersja robocza do przeglądu przez człowieka;
  • SHOW_CONFLICT — sprzeczne źródła i zakresy bez wymuszonego werdyktu;
  • SHOW_LIMITATION — brak pokrycia, aktualności lub praw do treści;
  • ABSTENTION — odmowa odpowiedzi;
  • HUMAN_REVIEW_REQUIRED — przekazanie do właściwej roli.

Kontrakt powinien zapisać:

answer_type: "SYNTHESIZED_ANSWER"
allowed_claim_types:
  - "fact_from_active_source"
citation_granularity: "claim_level"
uncertainty_required: true
conflict_policy: "show_and_route"
abstention_conditions:
  - "insufficient coverage"
  - "rights pending"
  - "out of scope"
  - "high-stakes without reviewer"
customer_facing_authorization: true

RAG jako architektura łączy pamięć parametryczną i zewnętrzne źródła, lecz pierwotna praca RAG wskazywała również otwarte problemy związane z pochodzeniem danych i aktualizacją wiedzy.15 Wyszukiwanie kontekstu nie przenosi mocy rozstrzygającej automatycznie na wynik.

Wysoka płynność języka nie może usuwać niepewności. System powinien odróżnić:

  • brak źródła;
  • źródło o małej mocy rozstrzygającej;
  • sprzeczność;
  • źródło nieaktualne;
  • niepełne wyszukiwanie;
  • inferencję;
  • wersję roboczą;
  • twierdzenie wymagające specjalisty.

Odpowiedź o wysokiej stawce, zobowiązanie wobec klienta, interpretacja prawa albo odpowiedź techniczna o dużym koszcie błędu mogą wymagać przeglądu przez człowieka niezależnie od jakości punktu odniesienia. Ten warunek łączy J08 z Rejestrem Ładu AI i Danych oraz z artykułem o ładzie AI i danych.

Cytowanie nie jest dowodem mocy rozstrzygającej ani oparcia twierdzenia

Odpowiedź może wyglądać wiarygodnie, gdy zawiera trzy linki. Weryfikacja wymaga jednak co najmniej czterech pytań:

  1. Czy wskazany fragment rzeczywiście zawiera twierdzenie?
  2. Czy twierdzenie nie wykracza poza znaczenie fragmentu?
  3. Czy źródło ma moc rozstrzygającą dla tego pytania?
  4. Czy wersja i czas obowiązywania są właściwe?

Cytowanie na poziomie źródła wskazuje dokument. Cytowanie na poziomie twierdzenia mapuje konkretne zdanie do dokładnego wskazania miejsca. W odpowiedziach wieloźródłowych druga forma ułatwia niezależną kontrolę i korektę. Web Annotation Data Model pokazuje, jak body, target i selectors mogą reprezentować dokładne powiązanie z fragmentem.26

Dwa układy jeden nad drugim. W obu z małej pustej tabliczki biegnie cienka linia do prostokąta z pięcioma poziomymi liniami w środku. W pierwszym układzie linia zatrzymuje się na krawędzi prostokąta. W drugim wchodzi do środka i kończy się na trzeciej linii, która jest złota.
fig. 01Cytowanie do dokumentu zatrzymuje się na jego krawędzi; cytowanie do zdania wskazuje wiersz, który twierdzenie ma potwierdzać

ALCE badało systemy generujące odpowiedzi z cytowaniami i zwróciło uwagę na poprawność oraz kompletność cytowań.17 Obecność cytowania nie wystarcza: model może przypisać źródło do niewłaściwego zdania albo użyć dokumentu, który wspiera jedynie część twierdzenia.

Przykład:

TWIERDZENIE:
„Model X działa w temperaturze do 120°C.”

CYTOWANIE:
Instrukcja Model X, strona 14.

RZECZYWISTE ŹRÓDŁO:
„120°C przez maksymalnie 15 minut w procedurze testowej,
nie w pracy ciągłej.”

Link jest prawidłowy technicznie, ale twierdzenie nie ma oparcia we wskazanym miejscu. Status powinien wskazywać brak oparcia twierdzenia we wskazanym źródle, a odpowiedź przejść do korekty.

Cytowanie powinno zachować identyfikator źródła, wersję, wskazanie miejsca i czas odpowiedzi. Link do „najnowszego dokumentu” może później prowadzić do innej treści niż ta, którą widział model. Dla audytu potrzebny jest niezmienny snapshot źródła albo równoważny dowód wersji.

Jak pokazywać sprzeczności i brak pokrycia

Przepływ pracy nad wiedzą nie powinien zamieniać niezgodności w płynny kompromis. Sprzeczność może wynikać z:

  • różnych okresów obowiązywania;
  • różnych jurysdykcji;
  • różnych produktów;
  • odmiennej mocy rozstrzygającej;
  • zmiany polityki;
  • błędu;
  • braku podpisu lub zatwierdzenia;
  • dwóch uzasadnionych szkół interpretacji.

Odpowiedź może mieć strukturę:

ŹRÓDŁO A:
twierdzenie, moc rozstrzygająca, wersja, czas obowiązywania

ŹRÓDŁO B:
twierdzenie, moc rozstrzygająca, wersja, czas obowiązywania

SPRZECZNOŚĆ:
co się różni

BIEŻĄCE ROZSTRZYGNIĘCIE:
brak / reguła tymczasowa / decyzja właściciela

OGRANICZENIE:
czego nie można wywnioskować

NASTĘPNY KROK:
wskazana osoba dokonująca przeglądu i termin

Brak pokrycia jest innym stanem. System może znaleźć źródła podobne, ale nie mieć materiału dla konkretnej jurysdykcji albo konfiguracji. Test zestawu pytań powinien zawierać pytania, dla których prawidłowa odpowiedź brzmi „nie mamy wystarczających dowodów”.

KILT łączył zadania wymagające wiedzy z określonym snapshotem wiedzy i pochodzeniem danych, pokazując wartość wspólnej podstawy ewaluacji.32 Dziedzina korporacyjna wymaga jednak dodatkowo mocy rozstrzygającej, praw do treści i uprawnień dostępu, których punkt odniesienia oparty na Wikipedii nie odzwierciedla.

SHOW CONFLICT i ABSTAIN powinny być widoczne w głównym interfejsie, nie ukryte w przypisie. Użytkownik musi wiedzieć, że odpowiedź nie jest rekomendacją. Jeżeli presja czasu skłania do wyboru jednego źródła mimo sprzeczności, system powinien wymagać jawnego właściciela, uzasadnienia i warunku tymczasowego.

IWS-7 — ocena jakości, pokrycie, sprzeczności i korekta

Ocena przepływu pracy nad wiedzą wymaga oddzielnych testów:

Warstwa Pytanie
Pokrycie Czy baza zawiera źródła potrzebne do zestawu pytań?
Kompletność wyników Czy system odnajduje znane istotne źródła?
Trafność wyników Czy najwyżej uszeregowane wyniki nie są zdominowane przez materiały nieistotne?
Uprawnienia dostępu Czy nieuprawnione źródła są wykluczane?
Aktualność Czy używana jest właściwa wersja i okres?
Wierność wobec źródła Czy odpowiedź pozostaje w granicach dostarczonego kontekstu?
Oparcie w cytowaniach Czy wskazanie miejsca wspiera twierdzenie?
Poprawność Czy odpowiedź spełnia kryterium domenowe?
Powstrzymanie się Czy system odmawia w odpowiednich przypadkach?
Użyteczność dla człowieka Czy użytkownik może zweryfikować i skorygować wynik?

RAGAS i ARES proponują komponentowe miary oraz podejścia z modelami oceniającymi, co może przyspieszyć testowanie.16 Automatyczne miary są jednak zależne od modelu, rubryki i dziedziny. Użycie o wysokiej stawce wymaga oceny przez człowieka, doboru próby i analizy testów niezaliczonych.

Zestaw testowy powinien być wersjonowany oraz rozdzielać:

  • ścieżki bezproblemowe;
  • trudne przypadki negatywne;
  • sprzeczności;
  • źródła nieaktualne;
  • źródła objęte ograniczeniami;
  • pytania nieobsługiwane;
  • wstrzyknięcie promptu;
  • pytania wieloetapowe;
  • ekstrakcję z tabel;
  • dokładne identyfikatory;
  • pytania wymagające powstrzymania się.

Przypadek testowy powinien wskazywać znane istotne źródła i dozwolony typ odpowiedzi. Dzięki temu błąd można przypisać do pokrycia, wyszukiwania, szeregowania, generowania odpowiedzi albo mapowania cytowań.

Korekta nie kończy się na zmianie odpowiedzi testowej. Jeżeli błąd wynikał z parsera lub rekordu źródła, trzeba skorygować pipeline, przebudować indeks i przejrzeć wcześniejsze wyniki. Właśnie dlatego Architektura Miar Sprzedaży i artykuł o KPI sprzedaży są ważnymi punktami odniesienia: miara musi prowadzić do reguły działania, a nie do dekoracyjnego pulpitu.

IWS-8 — aktualność, wygaśnięcie, wykrywanie zmian i przegląd

Aktualność nie jest jednym polem „ostatnia aktualizacja”. Należy rozdzielić:

  • datę publikacji;
  • początek obowiązywania;
  • koniec obowiązywania;
  • czas wczytania źródła;
  • datę przeglądu;
  • wygaśnięcie;
  • wskazanie wersji zastępującej;
  • historyczny snapshot;
  • zdarzenie wykrycia zmiany.

Dokument opublikowany dziś może wejść w życie za miesiąc. Starsza umowa może nadal obowiązywać konkretnego klienta. Historyczna polityka może być niezbędna do odtworzenia decyzji. Aktualność zależy więc od pytania i kontekstu czasowego.

FreshQA koncentrowało się na pytaniach, których odpowiedzi zmieniają się w czasie, podkreślając problem temporalnej aktualności wiedzy.17 Korporacyjny przepływ pracy powinien rozszerzyć to o moc rozstrzygającą, status źródła i daty obowiązywania.

Wykrywanie zmian może obejmować:

zmiana sumy kontrolnej źródła
zarejestrowana nowa wersja
alert o publikacji urzędowej
aneks do umowy
zatwierdzenie polityki
nota wydawnicza dostawcy
wygaśnięcie licencji
komunikat bezpieczeństwa
aktualizacja modelu albo parsera

Nie każda zmiana jest materialna. Reguła materialności powinna pytać, czy zmieniły się twierdzenia, zakres, prawa do treści, uprawnienia dostępu, struktura, daty obowiązywania albo zachowanie wyszukiwania. Materialna zmiana może wymagać:

WSTRZYMAJ NOWE ODPOWIEDZI
→ PORÓWNAJ RÓŻNICE
→ WCZYTAJ PONOWNIE
→ ZAINDEKSUJ PONOWNIE
→ PRZETESTUJ PONOWNIE
→ PRZEJRZYJ WCZEŚNIEJSZE ODPOWIEDZI
→ AUTORYZUJ PONOWNIE

Dla źródeł prawnych i regulacyjnych należy zachować dynamiczną ponowną walidację. AI Act zasadniczo stosuje się od 2 sierpnia 2026 r., z wyjątkami i etapami określonymi w rozporządzeniu, dlatego finalna publikacja po tej dacie wymaga ponownego sprawdzenia tekstu, wytycznych i ewentualnych zmian legislacyjnych.22 Podobnie status norm, licencji i dokumentacji dostawcy nie powinien być utrwalany bez daty przeglądu.

Stan STALE nie zawsze oznacza natychmiastowe usunięcie. Może oznaczać użycie wyłącznie historyczne, użycie objęte ograniczeniami albo obowiązek pokazania ograniczenia.

IWS-9 — informacja zwrotna, incydent, wycofanie źródła i propagacja

Informacja zwrotna powinna być powiązana z konkretnym obiektem:

  • źródło;
  • metadane;
  • fragment;
  • wynik wyszukiwania;
  • twierdzenie odpowiedzi;
  • cytowanie;
  • dostęp;
  • aktualność;
  • użycie w dole strumienia.

Zgłoszenie „odpowiedź jest zła” jest punktem startu, nie diagnozą. Rekord powinien zawierać rolę zgłaszającego, zapytanie, identyfikator odpowiedzi, wersje źródeł, skutek, właściciela, termin i status.

Incydent może dotyczyć:

  • INCYDENT WYSZUKIWANIA
  • INCYDENT CYTOWANIA
  • INCYDENT UPRAWNIEŃ
  • INCYDENT BEZPIECZEŃSTWA
  • INCYDENT AKTUALNOŚCI
  • SPRZECZNOŚĆ MOCY ROZSTRZYGAJĄCEJ
  • NADUŻYCIE W DOLE STRUMIENIA

Wstrzyknięcie promptu i zatrucie źródeł wymagają ograniczenia skutków. Treść źródła powinna być traktowana jako dane, nie instrukcja dla systemu. Jeżeli dokument próbuje zmienić zachowanie modelu albo ujawnić sekrety, może otrzymać status POISONED_OR_ADVERSARIAL, zostać wykluczony z indeksu i uruchomić przegląd bezpieczeństwa.2930

Wycofanie źródła może być wywołane przez:

  • wygaśnięcie licencji;
  • cofnięcie uprawnienia;
  • błąd merytoryczny;
  • nowszą wersję;
  • incydent;
  • żądanie usunięcia;
  • zmianę prawa;
  • utratę mocy rozstrzygającej;
  • naruszenie poufności.

Pełna ścieżka:

ZATRZYMAJ NOWE UŻYCIE
→ OGRANICZ ALBO ODBIERZ DOSTĘP
→ USUŃ Z AKTYWNEGO INDEKSU
→ ZIDENTYFIKUJ FRAGMENTY I EMBEDDINGI
→ PRZEBUDUJ INDEKS
→ ZIDENTYFIKUJ ODPOWIEDZI I MATERIAŁY
→ PRZEJRZYJ DECYZJE W DOLE STRUMIENIA
→ POPRAW ALBO WYCOFAJ
→ POWIADOM ODBIORCÓW
→ ZAPISZ POTWIERDZENIA
→ ZAMKNIJ POZOSTAŁOŚCI

To rozwija cykl życia z J06. Ład AI i danych definiuje wycofanie na poziomie przypadku użycia; J08 pokazuje, jak odnaleźć zależności wiedzy wewnątrz tego przypadku użycia.

IWS-10 — archiwizacja, usunięcie, przenoszalność i wygaszenie

Cztery operacje często są mylone:

Archiwizacja zachowuje zasób i historię dla określonego celu, ale usuwa go z aktywnego wyszukiwania albo ogranicza dostęp.

Usunięcie trwale kasuje treść lub dane zgodnie z uprawnioną decyzją, polityką retencji i ewentualną blokadą usunięcia na potrzeby prawne. Może wymagać usunięcia kopii, fragmentów, embeddingów i pamięci podręcznej.

Przenoszalność umożliwia eksport źródeł, metadanych, ścieżki pochodzenia danych, decyzji i historii w sposób pozwalający przenieść przepływ pracy albo zakończyć zależność od dostawcy.

Wygaszenie kończy działanie komponentu lub przepływu pracy nad wiedzą. Nie rozstrzyga automatycznie losu wcześniejszych odpowiedzi.

Zarządzanie dokumentacją wymaga kontroli tworzenia, przejęcia i cyklu życia niezależnie od formatu.18 Zasady FAIR promują odnajdywalność, dostępność, interoperacyjność i ponowne użycie, ale dostępność może być warunkowa, a ponowne użycie zależy od praw do treści.12 Przenoszalność i dostęp do danych mogą również podlegać Data Act w określonych zakresach.23

Plan wyjścia od dostawcy powinien ustalać:

  • format eksportu;
  • zakres metadanych;
  • sumy kontrolne źródeł;
  • ścieżkę pochodzenia fragmentów;
  • konfigurację indeksu;
  • zestaw testowy;
  • historię odpowiedzi;
  • grupy dostępu;
  • rejestr incydentów;
  • sposób potwierdzenia usunięcia;
  • termin wyłączenia integracji;
  • odbiorców w dole strumienia.

RETIRED nie może zostać uznane za domknięcie, jeżeli wcześniejsze odpowiedzi nadal funkcjonują jako polityki, oferty, instrukcje lub decyzje. Wygaszenie zatrzymuje nowe użycia; wycofanie i korekta rozwiązują skutki istniejące.

Przepływ pracy nad wiedzą może zostać zamknięty, gdy cel wygasł, utrzymanie nie ma właściciela, źródła są niedostępne, jakość pozostaje niewystarczająca albo ryzyko jest nieproporcjonalne. Zamknięcie nie jest porażką. Jest decyzją dotyczącą cyklu życia.

Content intelligence dla sprzedaży bez chaosu treści

Content intelligence bywa rozumiane jako analiza popularności treści, rekomendowanie materiałów albo ich personalizacja. W J08 oznacza coś węższego i bardziej operacyjnego: zdolność do określenia, które źródło, twierdzenie, wersja i fragment mogą wspierać określone pytanie, decyzję lub komunikację.

Dla sprzedaży może obejmować:

  • powiązanie pytań klientów z zatwierdzonymi źródłami;
  • identyfikację luk w pokryciu;
  • wykrywanie nieaktualnych materiałów;
  • mapowanie twierdzeń marketingowych do dowodów;
  • kontrolę wersji studiów przypadków i specyfikacji;
  • wsparcie ankiet bezpieczeństwa;
  • analizę pytań bez odpowiedzi;
  • proponowanie wersji roboczych z cytowaniami na poziomie twierdzenia;
  • korektę materiałów po zmianie źródła;
  • wycofanie materiałów zawierających twierdzenia bez oparcia w źródle.

Nie powinno natomiast automatycznie:

  • oceniać handlowców według liczby wyszukań;
  • utożsamiać często używanego materiału z wysoką jakością;
  • publikować nowych twierdzeń;
  • zmieniać polityki;
  • składać zobowiązań wobec klienta;
  • omijać przeglądu prawnego lub technicznego;
  • wykorzystywać dzienników zapytań do celów kadrowych bez osobnej podstawy.

Wartość systemu mierzy się nie tylko czasem wyszukiwania. Portfolio może obejmować:

pokrycie pytań priorytetowych
pokrycie i precyzja wyszukiwania
pokrycie twierdzeń cytowaniami
poprawność odpowiedzi
jakość powstrzymania się
udział źródeł nieaktualnych
czas do korekty
domknięcie korekt w dole strumienia
obciążenie użytkownika weryfikacją
rezultat po stronie klienta

Takie miary powinny mieć reguły działania i ograniczenia. Wysokie użycie bez korekty źródeł może jedynie szybciej skalować błąd. J08 łączy zatem sales enablement z zarządzaniem dokumentacją, pochodzeniem danych, prawami do treści i cyklem życia, zamiast traktować bibliotekę treści jako magazyn plików.

Dziesięć scenariuszy operacyjnych

1. Polityka rabatowa

Handlowiec pyta o maksymalny rabat dla niestandardowej umowy. System pobiera zatwierdzoną politykę i wskazuje limit standardowy. Ponieważ wyjątek wymaga mandatu, kontrakt odpowiedzi zwraca wyciąg ze źródła oraz warianty jako wersję roboczą. Nie komunikuje rabatu klientowi. Status źródła pozostaje ACTIVE, lecz granica działania należy do człowieka.

2. Dokumentacja techniczna produktu

W indeksie znajdują się trzy instrukcje. Jedna dotyczy modelu wycofanego, druga aktualnego, trzecia rynku poza UE. Filtry metadanych wybierają właściwą wersję. Stara instrukcja jest SUPERSEDED, a nie usunięta, ponieważ jest potrzebna do historycznych wdrożeń.

3. Prawo i oficjalne wytyczne

Użytkownik pyta o obowiązek regulacyjny. System pokazuje wiążący tekst i wytyczne, zaznacza datę obowiązywania i nie wydaje werdyktu prawnego. Wynik przechodzi do przeglądu specjalistycznego. Baza wspiera przygotowanie, nie zastępuje prawnika.

4. Studium przypadku dostawcy

Studium przypadku opisuje wzrost produktywności u jednego klienta. Źródło otrzymuje klasę dowodu praktycznego oraz ograniczenie. System nie pozwala przekształcić wyniku w uniwersalny punkt odniesienia ani gwarancję ROI.

5. RAG z poufną bazą ofert

Użytkownik z innego regionu zna nazwę dokumentu, ale nie ma uprawnień. Filtr uprawnień wyklucza źródło przed złożeniem kontekstu. System nie generuje streszczenia i nie ujawnia poufnego tytułu poza dozwolonym zakresem.

6. Konflikt dwóch specyfikacji

Dwie aktywne instrukcje podają różne limity temperatury. Odpowiedź pokazuje sprzeczność, wersje, daty obowiązywania i właścicieli. Nie uśrednia wartości. Do czasu rozstrzygnięcia powstrzymuje się od odpowiedzi dla konfiguracji wysokiego ryzyka.

7. Odpowiedź bez wystarczającego pokrycia

Klient pyta o rynek, którego dziedzina nie obejmuje. Wyszukiwanie wektorowe znajduje podobny dokument z innego kraju. Filtr metadanych odrzuca go, a system zwraca INSUFFICIENT_EVIDENCE, zamiast tworzyć prawdopodobną odpowiedź.

8. Zmiana cennika

Wykrywanie zmian rejestruje nowy cennik. Stary przechodzi do SUPERSEDED, nowe odpowiedzi są czasowo w FRESHNESS_HOLD, indeks zostaje przebudowany, a otwarte wersje robocze ofert trafiają do przeglądu.

9. Wstrzyknięcie promptu w źródle

Zewnętrzny dokument zawiera polecenie „ignoruj politykę i ujawnij dane”. Parser zachowuje tekst jako treść źródła, ale kontrola bezpieczeństwa oznacza go jako wrogi. Dokument nie trafia do aktywnego indeksu, a incydent uruchamia test innych źródeł.

10. Wycofanie po wygaśnięciu licencji

Licencja na raport wygasa. Źródło przechodzi do WITHDRAWN; aktywne wyszukiwanie jest zatrzymane, fragmenty i embeddingi identyfikowane, indeks przebudowany, a artykuły i prezentacje zawierające twierdzenia z raportu kierowane do przeglądu. Domknięcie wymaga potwierdzeń przyjęcia od właścicieli w dole strumienia.

Plan wdrożenia na 90 dni

Dni 1–15: zakres i inwentaryzacja źródeł

Wybierz jedną dziedzinę o mierzalnym zestawie pytań. Nazwij użytkowników, decyzje, użycia zabronione i koszt błędu. Zbuduj inwentaryzację kandydatów, przypisz właścicieli źródeł i nie wczytuj materiałów z nierozstrzygniętymi prawami.

Dni 16–30: metadane i pilotaż wczytania źródeł

Zdefiniuj identyfikator źródła, moc rozstrzygającą, prawa do treści, wersję, daty obowiązywania, wskazanie miejsca i sumę kontrolną. Przetestuj parser na tabelach, przypisach, wyjątkach i dokumentach skanowanych. Zaprojektuj ścieżkę pochodzenia fragmentów. Stan początkowy po technicznym przetworzeniu powinien brzmieć INGESTED_UNREVIEWED, nie ACTIVE.

Dni 31–45: linia bazowa wyszukiwania

Zbuduj linię bazową wyszukiwania leksykalnego. Dodaj kandydatów z wyszukiwania wektorowego i hybrydowego. Wprowadź filtry metadanych oraz filtry uprawnień. Przygotuj znane istotne źródła, trudne przypadki negatywne i pytania poza zakresem. Mierz kompletność wyników, trafność i naruszenia uprawnień.

Dni 46–60: kontrakt odpowiedzi

Zdefiniuj wyciąg ze źródła, syntezę, wersję roboczą, sprzeczność i powstrzymanie się. Wymagaj cytowań na poziomie twierdzenia dla materialnych twierdzeń. Dodaj ograniczenia i przegląd przez człowieka. Przetestuj fałszywe pokrycie oraz odpowiedzi płynne, ale bez oparcia w źródle.

Dni 61–75: aktualność, informacja zwrotna i bezpieczeństwo

Wprowadź rytm przeglądu, wygaśnięcie, porównywanie wersji źródła i wykrywanie zmian. Zbuduj informację zwrotną oraz ścieżki incydentu. Przetestuj wstrzyknięcie promptu, zatrucie źródeł, wyciek źródła objętego ograniczeniami i wersję nieaktualną.

Dni 76–90: ograniczony pilotaż i próbne wycofanie

Uruchom ograniczony pilotaż. Mierz jakość, pokrycie, obciążenie użytkownika i czas do korekty. Wybierz jedno źródło i przeprowadź kontrolowane wycofanie: zatrzymanie użycia, ponowne indeksowanie, przegląd odpowiedzi, powiadomienie w dole strumienia i dowód domknięcia.

Po 90 dniach decyzja nie musi brzmieć „skalować”. Prawidłowe wyniki to utrzymanie ograniczonego zakresu, zmniejszenie zakresu, zebranie dowodów, przeprojektowanie, wstrzymanie, wygaszenie albo wycofanie.

TOOL-J08 — Rejestr Źródeł i Wiedzy Sprzedażowej

TOOL-J08 przekłada IWS na wersjonowany zapis dla jednej dziedziny albo jednego przepływu pracy nad odpowiedziami. Nie jest pulpitem liczby dokumentów i nie generuje knowledge_maturity_score.

Główne karty:

  • DZIEDZINA I PYTANIA
  • REJESTR ŹRÓDEŁ
  • MOC ROZSTRZYGAJĄCA I WŁASNOŚĆ
  • PRAWA I UPRAWNIENIA
  • WCZYTANIE ŹRÓDŁA I METADANE
  • ŚCIEŻKA POCHODZENIA FRAGMENTÓW I INDEKSU
  • KONTRAKT WYSZUKIWANIA
  • KONTRAKT ODPOWIEDZI I CYTOWANIA
  • OCENA JAKOŚCI I TESTY NIEZALICZONE
  • AKTUALNOŚĆ I ZMIANA
  • INFORMACJA ZWROTNA I INCYDENTY
  • WYCOFANIE I ARCHIWIZACJA
  • DECYZJA KOŃCOWA I HISTORIA

Tryb szybki odpowiada na dwanaście pytań i może zakończyć się SPLIT DOMAIN, COLLECT SOURCE, RIGHTS REVIEW, NO INGESTION, ABSTAIN, HUMAN REVIEW, HOLD, WITHDRAW albo CLOSE NO ACTION. Nie tworzy autoryzacji produkcyjnej.

Model uprawnień rozdziela właściciela źródła, właściciela wiedzy, osobę oceniającą prawa do treści, osobę oceniającą ochronę danych, osobę oceniającą bezpieczeństwo, osobę oceniającą wyszukiwanie, osobę oceniającą odpowiedzi, właściciela decyzji i koordynatora wycofania. Administrator techniczny nie może zatwierdzić mocy rozstrzygającej, zmienić praw do treści ani usunąć testów niezaliczonych.

Narzędzie zachowuje pełny YAML, tryb dokumentu statycznego i historię. Eksport obejmuje źródła, metadane, fragmenty, indeksy, kontrakt wyszukiwania, kontrakt odpowiedzi, testy, aktualność, incydenty, odbiorców w dole strumienia oraz plan wycofania.

Przejście do narzędzia:

Otwórz Rejestr Źródeł i Wiedzy Sprzedażowej

J08 pozostaje powiązane z Kartą Przypadku Użycia AI w Pracy Handlowca: rekord źródła i dowody z wyszukiwania z J08 są wejściem do konkretnego zadania AI, lecz nie zastępują jego promptu, wyniku ani kontraktu przeglądu przez człowieka.

FAQ

Najczęstsze pytania

1. Czy baza wiedzy jest single source of truth?

Nie. Może być kontrolowanym środowiskiem źródeł dla określonego zakresu. Moc rozstrzygająca, sprzeczności, wersje i ograniczenia nadal muszą być widoczne.

2. Czy najnowsze źródło jest zawsze najlepsze?

Nie. Aktualność jest jednym wymiarem. Źródło może być nowsze, ale mieć mniejszą moc rozstrzygającą albo dotyczyć innego okresu i zakresu.

3. Czy publiczny dokument można zawsze zindeksować?

Nie. Publiczna dostępność nie przesądza praw do kopiowania, ekstrakcji, przekształcania, dalszego udostępnienia ani konkretnego zamierzonego użycia.

4. Czy RAG eliminuje halucynacje?

Nie. Wyszukiwanie kontekstu może poprawić oparcie odpowiedzi w źródłach, lecz błędy mogą powstać przy wczytaniu źródła, wyszukiwaniu, szeregowaniu, interpretacji, syntezie i cytowaniu.

5. Czy cytowanie oznacza, że odpowiedź jest prawdziwa?

Nie. Trzeba sprawdzić, czy źródło ma właściwą moc rozstrzygającą i czy wskazany fragment rzeczywiście wspiera twierdzenie.

6. Czy podobieństwo embeddingów oznacza trafność?

Nie. Podobieństwo jest sygnałem wyszukiwania. Trafność zależy od pytania, zakresu, czasu, jurysdykcji i zamierzonego użycia.

7. Czy wyszukiwanie wektorowe zawsze przewyższa BM25?

Nie. Wynik zależy od dziedziny i zestawu pytań. Potrzebny jest lokalny punkt odniesienia obejmujący wyszukiwanie leksykalne, wektorowe, hybrydowe i ponowne szeregowanie.

8. Czy można indeksować całe dokumenty bez dzielenia na fragmenty?

Czasem tak, ale decyzja wymaga testów. Długi kontekst nie gwarantuje, że model wykorzysta materialny fragment.

9. Jak dobrać wielkość fragmentu?

Przez testy na lokalnych pytaniach, strukturze dokumentów i wymaganych wskazaniach miejsca, nie przez uniwersalną wartość tokenów.

10. Czy tabela może być rozbita jak zwykły tekst?

Tylko gdy nie traci relacji między nagłówkami, wierszami, jednostkami i przypisami. W przeciwnym razie parsowanie lub dzielenie na fragmenty jest wadliwe.

11. Czym jest pochodzenie danych?

To informacja o encjach, osobach i procesach uczestniczących w powstaniu lub zmianie zasobu. W J08 obejmuje łańcuch źródło–wersja–fragment–indeks–odpowiedź.

12. Czy metadane są ważniejsze od treści?

Nie. Metadane nie zastępują treści, lecz umożliwiają kontrolę tożsamości, praw do treści, wersji, aktualności, uprawnień dostępu i wyszukiwania.

13. Co zrobić ze sprzecznymi źródłami?

Zachować sprzeczność, pokazać moc rozstrzygającą, zakres i daty obowiązywania, a następnie skierować do właściwego właściciela lub przeglądu specjalistycznego.

14. Czy system może sam wybrać źródło o największej mocy rozstrzygającej?

Może stosować reguły skierowania, ale moc rozstrzygająca zależy od twierdzenia i zakresu. Materialna sprzeczność wymaga jawnego przeglądu.

15. Kiedy system powinien powstrzymać się od odpowiedzi?

Gdy brakuje wystarczających dowodów, źródła są poza zakresem, prawa do treści są niejasne, sprzeczność jest nierozstrzygnięta albo wymagany jest specjalista.

16. Czy brak odpowiedzi jest błędem?

Nie. NO_ANSWER albo powstrzymanie się są prawidłowym wynikiem, jeżeli system nie ma podstaw do bezpiecznej odpowiedzi.

17. Czy każda odpowiedź wymaga cytowań na poziomie twierdzenia?

Materialne twierdzenia faktograficzne powinny mieć sprawdzalne wskazanie miejsca. Proste odpowiedzi oparte na kontrolowanych rekordach mogą użyć krótszego kontraktu.

18. Czy cytowanie na poziomie źródła wystarcza?

Nie zawsze. Lista dokumentów bez mapy twierdzenie–fragment może utrudniać weryfikację i ukrywać fałszywe pokrycie.

19. Jak mierzyć pokrycie?

Na zdefiniowanym zestawie pytań ze znanymi istotnymi źródłami, przypadkami negatywnymi, wyjątkami i pytaniami poza zakresem.

20. Jak mierzyć wierność wobec źródła?

Sprawdzać, czy odpowiedź nie dodaje twierdzeń bez oparcia w dostarczonych dowodach. Automatyczne miary należy kalibrować i uzupełniać przeglądem przez człowieka.

21. Czy LLM judge wystarczy do testów?

Nie dla każdego przypadku użycia. Wyniki modelu oceniającego zależą od modelu, rubryki i danych; przepływ pracy o wysokiej stawce wymaga oceny przez człowieka.

22. Jak mierzyć aktualność?

Przez datę obowiązywania, wersję źródła, rytm przeglądu, wygaśnięcie i wykrywanie zmian, nie tylko datę wczytania źródła.

23. Czym jest sprzeczność czasowa?

Sytuacja, w której źródła mogą być poprawne dla różnych okresów, ale system przedstawia je jak opis jednego stanu.

24. Czy aktualizacja pliku wystarcza?

Nie. Trzeba wykonać wersjonowanie, ponowne wczytanie, ponowne indeksowanie, ponowny test i w razie potrzeby przegląd wcześniejszych odpowiedzi.

25. Co oznacza status SUPERSEDED?

Źródło zostało zastąpione nowszą wersją, ale pozostaje w historii i może być potrzebne do odtworzenia wcześniejszej decyzji.

26. Co oznacza status WITHDRAWN?

Źródło nie może być dalej aktywnie używane; trzeba zatrzymać wyszukiwanie i przejrzeć zależne odpowiedzi oraz decyzje.

27. Czy usunięcie źródła usuwa embeddingi?

Nie automatycznie. Plan wycofania musi objąć kopie, fragmenty, indeksy, embeddingi, pamięć podręczną i magazyny w dole strumienia.

28. Czy można przechowywać stare wersje?

Tak, jeżeli retencja, uprawnienia dostępu i podstawa prawna na to pozwalają. Archiwum nie może mieszać się z aktywnym wyszukiwaniem.

29. Kto powinien być właścicielem źródła?

Rola zdolna potwierdzić moc rozstrzygającą, wersję, zakres i cykl życia źródła. Nie zawsze jest to administrator systemu.

30. Kto powinien być właścicielem wiedzy?

Rola odpowiedzialna za dziedzinę, zestaw pytań, kontrakt odpowiedzi, jakość i przegląd, bez przejmowania mocy rozstrzygającej wszystkich źródeł.

31. Czy administrator może zatwierdzić źródło?

Nie na podstawie samego dostępu technicznego. Zatwierdzenie wymaga właściwego mandatu i zamknięcia bram.

32. Czy system może korzystać z poufnych źródeł?

Tak, jeżeli cel, uprawnienia dostępu, retencja, bezpieczeństwo i prawa do treści są kontrolowane, a wyszukiwanie respektuje uprawnienia przed szeregowaniem i odpowiedzią.

33. Czy można używać notatek ze spotkań?

Tylko w zatwierdzonym celu, z odpowiednimi podstawami, przejrzystością, uprawnieniami dostępu, retencją i granicą wobec monitorowania lub użycia kadrowego.

34. Jak chronić bazę przed wstrzyknięciem promptu?

Traktować treść źródeł jako dane, izolować instrukcje, stosować listy dozwolonych źródeł, skanowanie treści, zasadę najmniejszych uprawnień, walidację wyniku i testy wrogie.

35. Czy zatruty dokument może wpływać na cały indeks?

Tak. Potrzebne są weryfikacja źródeł, ścieżka pochodzenia danych, izolacja, możliwość wycofania i przebudowy indeksu.

36. Czy content intelligence to content marketing?

Nie. W J08 oznacza kontrolowaną infrastrukturę źródeł, pytań, wyszukiwania kontekstu, odpowiedzi, informacji zwrotnej i cyklu życia.

37. Czy J08 buduje strategię treści?

Nie. Może zasilać operacje na treściach, ale nie zastępuje strategii, pozycjonowania, redakcji i zatwierdzania twierdzeń.

38. Czy J08 zastępuje J02?

Nie. J08 zarządza infrastrukturą wiedzy; J02 projektuje jedno zadanie wspierane przez AI, korzystające z tej infrastruktury.

39. Czy J08 zastępuje J06?

Nie. J06 prowadzi ład jednego przypadku użycia AI lub danych. J08 dostarcza źródło, wyszukiwanie kontekstu, aktualność i dowody wycofania.

40. Czy J08 zastępuje J07?

Nie. J07 wybiera podział pracy człowiek–technologia. J08 określa, z jakiej wiedzy może korzystać wybrany tryb.

41. Czy każde źródło musi być otwarte?

Nie. FAIR i interoperacyjność nie oznaczają braku kontroli dostępu. Źródło może być odnajdywalne i jednocześnie objęte ograniczeniami.

42. Czy można eksportować całą bazę?

Tylko zgodnie z prawami do treści, poufnością, retencją i kontraktem przenoszalności. Eksport musi zachować metadane i ścieżkę pochodzenia danych.

43. Jak wygląda tryb dokumentu statycznego?

To formularz i rejestr zachowujący rekordy źródeł, statusy, sprzeczności, testy, decyzje, korekty i wycofania bez wymagania aplikacji.

44. Czy narzędzie certyfikuje poprawność bazy?

Nie. Tworzy materiał decyzyjny i ślad audytowy; nie jest certyfikatem prawdy, legalności, bezpieczeństwa ani zgodności.

45. Kiedy należy zamknąć przepływ pracy nad wiedzą?

Gdy cel wygasł, źródła są niedostępne, jakość pozostaje niewystarczająca, ryzyko jest nieproporcjonalne albo utrzymanie nie ma właściciela.

Footnotes

  1. Autorska architektura metodyki „Nowoczesna Sprzedaż B2B” — układ dziesięciu obszarów, standard artykułu i narzędzia oraz granice publikacji.

  2. Autorskie założenia obszaru — AI, technologia, dane i RevOps: zakres modułów, modele i granice obszaru. Modele: IWS-1–IWS-10, SWI-0–SWI-12.

  3. Autorski przegląd redakcyjny modułu J07 — Nowoczesny handlowiec nie jest po prostu cyfrowy.

  4. J02 — AI w pracy handlowca i Karta Przypadku Użycia, J02 — AI w pracy handlowca B2B + J02 — Karta Przypadku Użycia AI w Pracy Handlowca — Source set, retrieval, output contract, citation, testing, human review, incident i wycofanie dla AI tasku. Ograniczenie: Dotyczy jednego AI-assisted przypadku użycia, nie pełnego knowledge domain.

  5. J06 — Governance AI i Danych, J06 — Ład AI i danych w sprzedaży + J06 — Rejestr Ładu AI i Danych — Inventory, purpose, permissions, testing, authorization, incident, revalidation i downstream wycofanie. Ograniczenie: Nie definiuje pełnego metadata, retrieval i answer przepływ pracy J08.

  6. Regulation (EU) 2016/679 — GDPR, https://eur-lex.europa.eu/eli/reg/2016/679/oj/eng — Purpose limitation, minimization, accuracy, storage limitation, security i rights dla danych osobowych. Ograniczenie: Nie dotyczy wszystkich źródeł; konkretne zastosowanie wymaga lokalnej analizy prawnej. 2

  7. Directive (EU) 2019/790 — Copyright in the Digital Single Market, https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng — Copyright, licensing i wyjątki, w tym text and data mining, w prawie UE. Ograniczenie: Transpozycja i warunki wyjątku wymagają sprawdzenia w konkretnej jurysdykcji. 2

  8. Directive 96/9/EC — Legal protection of databases, https://eur-lex.europa.eu/eli/dir/1996/9/oj/eng — Ochrona baz danych i rozróżnienie kolekcji systematycznie dostępnych materiałów. Ograniczenie: Nie rozstrzyga wszystkich praw do poszczególnych elementów bazy. 2

  9. Directive (EU) 2016/943 — Trade Secrets, https://eur-lex.europa.eu/eli/dir/2016/943/oj/eng — Ochrona poufnego know-how i informacji biznesowych przed bezprawnym pozyskaniem, użyciem i ujawnieniem. Ograniczenie: Status tajemnicy i reasonable measures wymagają konkretnej oceny. 2

  10. W3C Data Catalog Vocabulary (DCAT) Version 3, https://www.w3.org/TR/vocab-dcat-3/ — Interoperacyjny opis katalogów, datasets, distributions, versioning i series. Ograniczenie: DCAT nie rozstrzyga prawdziwości ani fitness for use. 2 3

  11. DCMI Metadata Terms, https://www.dublincore.org/specifications/dublin-core/dcmi-terms/2020-01-20/ — Podstawowe pola opisu zasobów, rights, dates, identifiers, relations i provenance. Ograniczenie: Minimalny vocabulary; domain-specific contract wymaga rozszerzenia. 2

  12. FAIR Guiding Principles, https://www.go-fair.org/fair-principles/ — Findability, accessibility, interoperability, reuse i machine-actionable metadata. Ograniczenie: FAIR nie oznacza open-by-default ani braku access controls. 2

  13. Karpukhin et al. — Dense Passage Retrieval, https://arxiv.org/abs/2004.04906 — Wyszukiwanie wektorowe jako testowalna alternatywa dla wyszukiwania rzadkiego w open-domain QA. Ograniczenie: Wyniki dla określonych zbiorów danych; nie uzasadniają samego wyszukiwania wektorowego w każdej dziedzinie. 2

  14. Thakur et al. — BEIR, https://arxiv.org/abs/2104.08663 — Heterogeniczny punkt odniesienia, uogólnienie poza rozkładem i silna rola BM25 oraz ponownego szeregowania w zależności od zadania. Ograniczenie: Punkt odniesienia nie zastępuje lokalnego zestawu pytań, języka i uprawnień. 2

  15. Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, https://arxiv.org/abs/2005.11401 — Rozdzielenie pamięci parametrycznej i nieparametrycznej oraz otwarte problemy pochodzenia danych i aktualizacji wiedzy. Ograniczenie: Eksperyment badawczy z konkretnymi modelami i korpusem; nie dowodzi jakości każdego RAG. 2

  16. RAGAS i ARES — evaluation frameworks, https://arxiv.org/abs/2309.15217 ; https://arxiv.org/abs/2311.09476 — Rozdzielenie trafności kontekstu, wierności odpowiedzi i trafności odpowiedzi; potrzeba komponentowej ewaluacji. Ograniczenie: Automatyczne miary i modele oceniające zależą od modelu i dziedziny; nie zastępują oceny przez człowieka. 2

  17. ALCE i FreshQA, https://arxiv.org/abs/2305.14627 ; https://arxiv.org/html/2310.03214v1 — Ocena jakości cytowań oraz testowanie pytań, których odpowiedzi zmieniają się w czasie. Ograniczenie: Punkty odniesienia nie tworzą pełnej mocy rozstrzygającej, praw do treści ani polityki aktualności dla wiedzy korporacyjnej. 2 3

  18. ISO 15489-1:2016 — Records management — Concepts and principles, https://www.iso.org/standard/62542.html — Creation, capture, metadata, responsibilities, controls i lifecycle records niezależnie od formatu. Ograniczenie: Nie jest specyfikacją wyszukiwarki ani modelu generatywnego. 2

  19. W3C PROV-O i PROV-DM, https://www.w3.org/TR/prov-o/ ; https://www.w3.org/TR/prov-dm/ — Model provenance dla entities, activities i agents; lineage source–process–output. Ograniczenie: Nie narzuca polityki authority, rights ani jakości. 2

  20. W3C Data Quality Vocabulary, https://www.w3.org/TR/vocab-dqv/ — Opis quality measurements, update frequency, correction i fitness-for-purpose information. Ograniczenie: Nie dostarcza kompletnej definicji jakości ani progów dla J08.

  21. ISO 30401:2018 — Knowledge management systems — Requirements, https://www.iso.org/standard/68683.html — Ustanawianie, utrzymywanie, przegląd i doskonalenie systemu zarządzania wiedzą. Ograniczenie: Standard zarządczy; nie określa architektury RAG ani nie certyfikuje konkretnej implementacji. ISO wskazuje trwającą rewizję; sprawdzić aktualny status przed użyciem.

  22. Regulation (EU) 2024/1689 — Artificial Intelligence Act, https://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng — Role, transparency, documentation, human oversight i lifecycle obligations zależne od przypadku użycia. Ograniczenie: J08 nie klasyfikuje automatycznie systemu; terminy i guidance wymagają rewalidacji po 2026-08-02. 2

  23. Regulation (EU) 2023/2854 — Data Act, https://eur-lex.europa.eu/eli/reg/2023/2854/oj/eng — Dostęp, użycie, udostępnianie danych oraz zmiana dostawcy i przenoszalność w określonych zakresach. Ograniczenie: Nie tworzy ogólnego prawa do dowolnej treści ani danych; stosowanie jest kontekstowe. 2

  24. W3C Shapes Constraint Language (SHACL), https://www.w3.org/TR/shacl/ — Walidacja struktur i ograniczeń dla grafów danych; możliwy wzorzec walidacji metadanych. Ograniczenie: Nie jest kompletnym przepływem pracy zatwierdzania ani testem semantycznej poprawności treści.

  25. OpenLineage specification, https://openlineage.io/docs/ ; https://openlineage.io/docs/spec/object-model/ — Model dataset, job, run, event i extensible facets dla lineage i change impact. Ograniczenie: Projekt open-source; nie zastępuje source authority i rights governance.

  26. W3C Web Annotation Data Model, https://www.w3.org/TR/annotation-model/ — Interoperacyjny model annotations, body, target i selectorów; claim-level locators. Ograniczenie: Nie przesądza authority i legal permissions anotowanego materiału. 2

  27. Asai et al. — Self-RAG, https://arxiv.org/abs/2310.11511 — Adaptacyjne wyszukiwanie, krytyka i autorefleksja zamiast bezwarunkowego pobierania stałej liczby fragmentów. Ograniczenie: Model badawczy; autorefleksja nie jest gwarancją poprawności ani ładu.

  28. Liu et al. — Lost in the Middle, https://arxiv.org/abs/2307.03172 — Pozycja istotnej informacji i długość kontekstu mogą wpływać na wykorzystanie dowodów. Ograniczenie: Wyniki zależne od modeli i testów z okresu badania; wymagają lokalnej replikacji dla nowych modeli.

  29. NIST AI RMF — Generative AI Profile (NIST AI 600-1), https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence — Ryzyka integralności informacji, pochodzenia treści, testowania, monitorowania i obsługi incydentów dla GenAI. Ograniczenie: Model dobrowolny; nie jest prawem ani certyfikatem zgodności. 2

  30. OWASP Top 10 for LLM Applications 2025, https://genai.owasp.org/llm-top-10/ — Prompt injection, sensitive information disclosure, data/model poisoning, vector/embedding weaknesses i improper output handling. Ograniczenie: Lista ryzyk tworzona przez społeczność; nie zastępuje modelowania zagrożeń, testów i wymagań prawnych. 2

  31. Directive (EU) 2022/2555 — NIS2, https://eur-lex.europa.eu/eli/dir/2022/2555/oj/eng — Zarządzanie ryzykiem cyberbezpieczeństwa i obowiązki dotyczące incydentów dla objętych podmiotów. Ograniczenie: Zakres podmiotowy i implementacja krajowa wymagają odrębnego przeglądu.

  32. Petroni et al. — KILT, https://arxiv.org/abs/2009.02252 — Wspólny snapshot źródła, zadania w dole strumienia i pochodzenie danych jako element ewaluacji systemów wymagających wiedzy. Ograniczenie: Punkt odniesienia oparty na Wikipedii; nie reprezentuje korporacyjnej mocy rozstrzygającej i praw do treści.

TOOL-J08 / od lektury do pracy

Osobna strona karty →

Rejestr Źródeł i Wiedzy Sprzedażowej

Siedem pytań o to, skąd zespół bierze odpowiedzi — i które źródło wygrywa przy sprzeczności.

Zespół odpowiada klientom z pamięci, z prezentacji sprzed roku i z rozmowy na korytarzu. Siedem pytań ustala, które źródło jest rozstrzygające, kto je utrzymuje i co robić, kiedy dwa mówią co innego.

Pobierz kartę (PDF)Pracuj na tym w B2B Sales Ops →piętnaście minut na jeden obszar wiedzy

Arkusz — 7 pytań

  1. 01 · Na jakie pytania to ma odpowiadać

    Czyje pytania — i w jakim zakresie?

  2. 02 · Skąd biorą się odpowiedzi dzisiaj

    Z dokumentów, od ludzi czy z pamięci?

  3. 03 · Które źródło rozstrzyga

    Co wygrywa, kiedy dwa mówią co innego?

  4. 04 · Kto je utrzymuje

    Kto aktualizuje — i jak często?

  5. 05 · Co jest poufne

    Czego nie wolno pokazać klientowi ani wysłać dalej?

  6. 06 · Co, kiedy nie ma odpowiedzi

    Czy wolno powiedzieć „nie wiem" — i do kogo skierować?

  7. 07 · Decyzja

    Zostawiacie, wskazujecie źródło rozstrzygające, porządkujecie czy budujecie wyszukiwanie?

Kiedy sięgnąć

  • na to samo pytanie klienta padają trzy różne odpowiedzi;
  • najświeższa wersja materiału jest w czyjejś skrzynce;
  • nikt nie wie, czy dokument nadal obowiązuje;
  • odpowiedzi powstają z pamięci, bo szukanie trwa dłużej;
  • ktoś chce zbudować na tym wyszukiwanie albo asystenta.

Co z tego wychodzi

Dwa dokumenty mówią co innego i oba obowiązują
Wskażcie rozstrzygający. Wróć do pytania 3 — bez tego każde wyszukiwanie tylko powieli spór, i to szybciej.
Najświeższa wersja jest w czyjejś skrzynce
To nie jest źródło, tylko czyjaś kopia — i znika razem z tą osobą.
Nikt nie utrzymuje materiału
Za rok będzie mylił. Materiał bez właściciela starzeje się cicho i nikt nie zauważa momentu, w którym przestał być prawdziwy.
Chcecie zbudować wyszukiwanie na nieuporządkowanych źródłach
Najpierw pytania 3 i 4. Wyszukiwanie po bałaganie zwraca bałagan — tylko sprawniej i z większą pewnością siebie.
Nie ma zgody na powiedzenie „nie wiem"
Zespół będzie zgadywał. To najdroższy brak w całym rejestrze i najłatwiejszy do usunięcia.

Ten arkusz wypełnia się raz, na papierze albo w pliku. Praca ciągła należy do aplikacji B2B Sales Ops — tam temat przechodzi z czytania w pracę: aplikacja prowadzi przez pola, kontekst i zapisuje wynik jako artefakt.

Poznaj B2B Sales Ops →

O metodyce

Ten artykuł jest częścią autorskiej metodyki Nowoczesna Sprzedaż B2B Jarosława Jaśkowiaka — systemu pracy ze sprzedażą B2B jako całością: decyzją klienta, wartością, rozmową, ryzykiem, kompetencjami i technologią. Poznaj autora albo wróć do obszaru J.

ID: J08przegląd: 2026-07-04metodyka autorska — nie stanowi porady prawnej ani HR