AI w firmie

Dlaczego zespoły ufają sztucznej inteligencji za bardzo albo wcale

Jedni pracownicy wierzą każdej odpowiedzi narzędzia, inni rezygnują po pierwszym błędzie, a kartka z czterema punktami koryguje oba zachowania.

Baltimore, rok 2001. Peter Pronovost, lekarz intensywnej terapii ze szpitala Johns Hopkins, przez miesiąc chodzi po oddziale z kartką i zapisuje, czy lekarze zakładający cewnik do dużej żyły, czyli cienką rurkę wprowadzaną blisko serca, żeby podawać pacjentowi leki i płyny, wykonują pięć czynności chroniących przed zakażeniem. Wśród nich są umycie rąk i odkażenie skóry chlorheksydyną, a więc rzeczy, które lekarz zna od pierwszego roku studiów. Po miesiącu Pronovost liczy i wychodzi mu, że u ponad jednej trzeciej pacjentów pominięto przynajmniej jeden krok.

Rozwiązanie, które zaproponował, wyglądało w szpitalnej hierarchii na zuchwałość: pielęgniarki dostały prawo wstrzymania zabiegu, gdy lekarz opuści punkt z listy. Osoba stojąca niżej w hierarchii mogła więc powiedzieć specjaliście z wieloletnim stażem, że musi zacząć od nowa. Po piętnastu miesiącach odsetek zakażeń w ciągu pierwszych dziesięciu dni z cewnikiem spadł w tym szpitalu z 11 procent do zera, co według szacunków oznaczało 43 uniknięte zakażenia, 8 uniknionych zgonów i około 2 miliony dolarów oszczędności.

W 2003 roku ten sam schemat wprowadzono w stanie Michigan. W 103 oddziałach intensywnej terapii mediana zakażeń na tysiąc dni z cewnikiem spadła z 2,7 do zera w ciągu trzech miesięcy, co w grudniu 2006 roku opisał tygodnik medyczny New England Journal of Medicine, a w pierwszych osiemnastu miesiącach programu uratowano według szacunków ponad półtora tysiąca osób. Najskuteczniejszym lekiem okazała się kartka papieru wraz z przyzwoleniem, żeby ktoś stojący niżej powiedział „stop”. Czy zespół, który wie wszystko, co trzeba, potrzebuje jeszcze pozwolenia, żeby to powiedzieć na głos?

Narzędzia sztucznej inteligencji (w skrócie AI), czyli programy tworzące odpowiedzi i rekomendacje na podstawie wzorców wyuczonych z ogromnych zbiorów tekstów, uruchamiają w firmach ten sam mechanizm. Ludzie wiedzą, że wynik trzeba sprawdzić, a część z nich i tak tego nie robi, podczas gdy inni po pierwszej pomyłce odkładają narzędzie na dobre. Oba zachowania mają psychologiczne źródło i oba koryguje krótka procedura z prawem do sprzeciwu, zbudowana na wzór listy Pronovosta.

Dlaczego płynna odpowiedź wydaje się prawdziwa

Model językowy, czyli program dopisujący kolejne słowa na podstawie wzorców z miliardów przeczytanych stron, buduje zdania gładkie i pewne siebie, niezależnie od tego, czy ich treść jest prawdziwa. Ludzki umysł odczytuje płynność jako sygnał kompetencji (psychologowie nazywają to efektem łatwości przetwarzania), więc gładki akapit z błędem budzi mniej podejrzeń niż poszarpana notatka z prawdą. Dochodzi do tego błąd automatyzacji, opisany w psychologii pracy: im częściej maszyna ma rację, tym mniej uwagi poświęcamy sprawdzaniu jej wyników, a po kilku tygodniach bezbłędnej pracy sprawdzanie zanika zupełnie.

Mocnego dowodu dostarcza badanie z 2023 roku, które badacze z Harvard Business School i innych uczelni przeprowadzili razem z Boston Consulting Group, jedną z największych firm doradczych na świecie. Wzięło w nim udział 758 konsultantów, czyli około 7 procent doradców na poziomie wykonawczym w tej firmie, a pracowali z modelem GPT-4 firmy OpenAI. Przy zadaniach mieszczących się w możliwościach modelu konsultanci wykonali o 12,2 procent więcej zadań, zrobili je o 25,1 procent szybciej, a niezależni oceniający uznali jakość za wyższą o ponad 40 procent.

Na zadaniu ustawionym celowo tuż poza możliwościami modelu wynik odwrócił się: konsultanci z narzędziem byli o 19 punktów procentowych rzadziej skłonni do poprawnej odpowiedzi niż koledzy, którzy pracowali bez niego. Autorzy nazwali tę granicę nierówną, bo przebiega w miejscach, których użytkownik nie widzi: model rozwiązuje bez wysiłku zadanie wyglądające na trudne, a potyka się na takim, które wygląda na proste. Dla menedżera wniosek jest bardzo konkretny, bo pracownik nie ma jak rozpoznać, po której stronie granicy się znajduje, kiedy odpowiedź brzmi tak samo przekonująco w obu przypadkach.

Dlaczego po pierwszym błędzie te same osoby przestają używać narzędzia

Odwrotne zachowanie opisali w 2015 roku Berkeley Dietvorst, Joseph Simmons i Cade Massey w pracy „Algorithm Aversion”, czyli niechęć do algorytmów. W ich eksperymentach uczestnicy, którzy zobaczyli, jak algorytm prognozujący popełnia błąd, rzadziej na nim polegali, choć jego prognozy były średnio trafniejsze od ludzkich. Pomyłkę człowieka tłumaczymy okolicznościami, a pomyłkę maszyny zapamiętujemy jako dowód wady konstrukcyjnej.

Ta sama grupa badaczy opublikowała później w czasopiśmie Management Science wynik, który ma dla firm wartość praktyczną: ludzie chętniej korzystają z niedoskonałego algorytmu, jeśli mogą choćby w niewielkim stopniu zmodyfikować jego wynik. Poczucie sprawczości odbudowuje zaufanie, a możliwość poprawienia odpowiedzi zmienia rolę narzędzia z narzuconego kontrolera w asystenta, którego wyniki podlegają redakcji.

Co lista kontrolna załatwia, a czego nie potrafi

Oba mechanizmy łączy brak wspólnej, jawnej reguły postępowania z wynikiem narzędzia. Lista kontrolna ją dostarcza: zamienia indywidualne poczucie „chyba jest dobrze” na czynność, którą można wykonać i odhaczyć. Kosztuje tyle, co półgodzinne spotkanie i kilka minut dodatkowej pracy przy każdym dokumencie, a żadnej licencji nie wymaga.

Granice są wyraźne. Lista nie powie pracownikowi, czy zadanie leży po właściwej stronie nierównej granicy, bo tego dowiaduje się wyłącznie przez sprawdzenie na przykładach, w których znamy prawidłową odpowiedź. Ryzykiem jest też rytuał: po miesiącu ludzie odhaczają punkty bez patrzenia, dokładnie tak, jak lekarze Pronovosta pomijali kroki, które znali na pamięć. Dlatego drugim elementem rozwiązania pozostaje prawo do sprzeciwu, czyli przyzwolenie dla każdego członka zespołu, także stażysty, na wstrzymanie dokumentu, w którym pominięto sprawdzenie.

Granicę da się jednak zbadać we własnym zakresie, i to tanio. Wystarczy zestaw kilkunastu zadań z dotychczasowej pracy zespołu, na które odpowiedzi są znane (stare reklamacje z rozstrzygnięciem, umowy z oznaczonymi zapisami, zestawienia z policzonym wynikiem), i przepuszczenie ich przez narzędzie, najlepiej w wersji, którą zespół naprawdę używa, bo po każdej aktualizacji modelu granica przesuwa się w nieznanym kierunku. Dwie godziny takiego testu dają więcej niż dowolna prezentacja dostawcy, ponieważ pokazują błędy na materiale, który pracownicy znają i mogą ocenić sami.

Cztery pytania do każdego dokumentu przygotowanego z udziałem narzędzia

Poniższa procedura mieści się na jednej kartce i dotyczy każdego tekstu lub tabeli, które wychodzą poza zespół:

  1. Źródła: każda liczba, nazwa, data i przepis mają wskazane źródło, a dwie losowo wybrane pozycje zostały sprawdzone w oryginale.
  2. Zakres zadania: osoba odpowiedzialna napisała jednym zdaniem, czy narzędzie robiło coś, co zespół już wcześniej sprawdził na przykładzie ze znaną odpowiedzią.
  3. Dane wejściowe: do narzędzia nie trafiły dane osobowe klientów i pracowników ani zapisy poufnych umów.
  4. Podpis: nazwisko osoby, która przeczytała całość, a nie tylko streszczenie, i która może wstrzymać wysyłkę.

Pierwszy krok na poniedziałek rano

Wybierz jeden proces, w którym wyniki narzędzia trafiają do klienta albo do decyzji o ludziach: ofertę handlową albo ocenę kandydata. Zbierz pięć osób, które z nim pracują, włącznie z najmłodszym stażem, i przez pół godziny przepiszcie powyższe cztery pytania do własnych słów, dopasowując je do tego procesu. Wyznaczcie osobę z najniższym stanowiskiem w tej grupie jako tę, która ma wprost zapisane prawo wstrzymania wysyłki, i poproście kierownika, żeby przy całym zespole publicznie to potwierdził.

Przez następny miesiąc prowadźcie wspólny arkusz, w którym każdy błąd narzędzia dostaje jeden wiersz: co było nie tak, czy wychwycono to przed wysyłką i ile minut zajęła poprawka. Arkusz odpowiada na pytanie, które w przeciwnym razie zostaje domysłem: czy narzędzie myli się w dwóch przypadkach na sto, czy w dwudziestu. Liczba z arkusza zastępuje wtedy wspomnienie jednej głośnej wpadki, które po jej zobaczeniu zwykle decyduje o ocenie całego narzędzia.

Po miesiącu zespół będzie wiedział więcej, niż wie dziś większość działów: w których rodzajach zadań narzędzie działa bez zastrzeżeń, a w których wymaga zawsze drugiej pary oczu. Lista przestaje być ogólną procedurą i staje się mapą, którą można pokazać nowemu pracownikowi pierwszego dnia, razem z zapisem, kto ma prawo powiedzieć „stop”. Czy w twojej firmie istnieje dziś osoba z takim prawem, o którym jej przełożony wie?