ELO dla inżynierów. Z uzasadnieniem w komplecie.
Szachy rozwiązały problem uczciwego rankingu dekady temu: oceniaj graczy po tym, kto z kim wygrywa, i śledź, jak bardzo jesteś pewien każdej liczby. DevEval stosuje tę samą matematykę — Glicko-2 — do pracy inżynierskiej. Każdy rating ma poziom pewności i pisemne uzasadnienie, które można audytować.
Mecz porównuje pracę dwóch deweloperów z ostatnich 30 dni.
AI czyta niedawną pracę obojga — pull requesty, review, dyskusje — i wydaje werdykt per wymiar oraz ogółem: kto wypadł lepiej, z jaką pewnością i dlaczego. Ten werdykt zasila aktualizację ratingu Glicko-2.
Zbiorczy dashboard mówi „78 vs 65” — i nie umie powiedzieć dlaczego.
Werdykt wskazuje zwycięzcę, wymiar, pewność i dowody. Nie zgadzasz się z którymś? Otwórz PR-y, które cytuje, i dyskutuj z uzasadnieniem, nie z liczbą.
Glicko-2, nie zwykłe ELO.
Zwykłe ELO daje każdemu liczbę. Glicko-2 mówi dodatkowo, jak bardzo można jej ufać — i to właśnie czyni ranking użytecznym w organizacji, a nie tylko w klubie szachowym.
Każdy deweloper startuje z maksymalną niepewnością, a nie z fałszywie precyzyjnym ratingiem. System wie, czego jeszcze nie wie — i mówi to wprost.
Każdy werdykt zacieśnia przedział niepewności wokół ratingu. Rating 1500 oparty na kilku porównaniach bezpośrednich nie znaczy tego samego co rating 1500 potwierdzony wieloma takimi porównaniami.
Ratingi stabilizują się po mniej więcej 10 porównaniach — czyli około dwóch tygodniach normalnej aktywności. Bez półrocznej kalibracji, zanim liczby zaczną coś znaczyć.
System dobiera wyrównane i porównywalne pary, zamiast zestawiać je losowo. Gdy rating osiągnie wysoki poziom pewności, system ogranicza liczbę porównań, a później okresowo weryfikuje wynik. Dzięki temu ranking pozostaje aktualny.
Siła względna, pozycja i dostarczona wartość.
DevEval rozdziela trzy pytania, które zbiorczy wynik wrzuca do jednego worka: jak ktoś wypada na tle innych, gdzie znajduje się w organizacji i ile wartości faktycznie dostarczył.
Rating ELO / Glicko-2
Względna siła w każdym wymiarze. Zmienia się po werdyktach z porównań parami, gdy jeden deweloper wypada lepiej od drugiego.
Percentyl
Gdzie znajdujesz się w organizacji, na przykład „lepszy niż 87% w jakości kodu”. Odpowiada na pytanie z oceny okresowej w jednej linijce.
Punkty absolutne
Ile wartości faktycznie zostało dostarczone. Punkty absolutne nie są grą o sumie zerowej, więc mogą rosnąć w całej organizacji jednocześnie. Pokazują skalę kontrybucji i wspierają oceny kwartalne.
Jeden system pokazuje obie odpowiedzi naraz: kto jest najsilniejszy (stabilne) i o ile więcej dowozimy (rośnie). Pojedynczy zbiorczy wynik rozmyłby oba pytania w liczbę, która nie odpowiada na żadne.
Dlaczego werdykty z porównań parami są lepsze niż średnie.
Zbiorcze średnie to powód, dla którego engineering analytics bywa ignorowany. Werdykty są zbudowane tak, żeby dało się z nimi dyskutować — i żeby tę dyskusję przetrwały.
Uruchom pierwsze porównania na własnym zespole.
Podłącz repozytorium i pozwól ruszyć pierwszym pojedynkom — ratingi stabilizują się w około dwa tygodnie normalnej aktywności.