Niestabilny test z konkretną przyczyną
Zbiera nieudane uruchomienia, grupuje objawy, odtwarza konflikt czasowy i przygotowuje najmniejszą sprawdzoną poprawkę.
Na czym polega ten pomysł
Zbiera nieudane uruchomienia, grupuje objawy, odtwarza konflikt czasowy i przygotowuje najmniejszą sprawdzoną poprawkę. Oddziela obserwowane fakty od wniosków, pokazuje sprzeczne dowody i dostarcza zestaw ustaleń gotowy do przeglądu zamiast nieprzejrzystej odpowiedzi.
Co zyskujesz
Losowe awarie CI stają się naprawialne zamiast kończyć się kolejnym rerunem.
Co zmienia agent AI
Jak wyglądało to wcześniej
Tradycyjna automatyzacja potrafiła zebrać rekordy, ale człowiek nadal musiał porównać źródła, rozstrzygnąć sprzeczności i opisać wnioski.
Co zmienia agent AI
Agent planuje research, sprawdza wiele źródeł, oddziela fakty od wniosków i zwraca raport z odnośnikami.
Kiedy agent zaczyna działać
Test naprzemiennie przechodzi i pada w porównywalnych uruchomieniach CI.
Dane wejściowe
- Kontekst procesu: logi CI, timingi, seedy, środowisko, kod testu i ostatnie zmiany
- Zatwierdzone zasady, odpowiedzialność i reguły wyjątków
Jak agent działa krok po kroku
- 1
Zbiera materiały z zatwierdzonych systemów i zapisuje czas ich pozyskania.
- 2
Porównuje sprzeczne sygnały i oddziela fakty od wniosków.
- 3
Przygotowuje odtworzoną przyczynę, poziom pewności i minimalną naprawę z cytowaniami, niewiadomymi i poziomem pewności.
- 4
Dostarcza zatwierdzony raport i zachowuje jego zestaw dowodów.
Decyzje człowieka
Po kroku 3
Osoba odpowiedzialna za proces zatwierdza odtworzoną przyczynę, poziom pewności i minimalną naprawę.
Rezultat
- Poprawka niestabilnego testu po review inżyniera
- Dowody, wyjątki i ślad audytowy
Zasady bezpieczeństwa
- Oznaczaj wnioski oddzielnie od obserwowanych faktów.
- Nie zamykaj dochodzenia, gdy wymagane źródła są niedostępne.
Ryzyka i zabezpieczenia
Brakujące lub nieaktualne dowody mogą dać pewne, ale niepełne ustalenie.
Pokazuj wykorzystane źródła, sprzeczności, daty danych i pytania bez odpowiedzi.
Na czym opieramy ten pomysł
Źródła pokazują, że taki scenariusz jest wykonalny. Podany zakres poprawy to punkt odniesienia, a nie obietnica wyniku.
OpenAI
New tools for building agents
OpenAI opisuje agentów łączących research w sieci, pliki, sterowanie przeglądarką, narzędzia, handoffy, guardraile i śledzone wykonanie wielu kroków.
Langfuse
Evaluating AI agent skills
Langfuse pokazuje agentów zamieniających trace produkcyjne i feedback ludzi w datasety, eksperymenty i mierzalne testy regresji.