← DevEval Ranking head-to-head

ELO dla inżynierów. Z uzasadnieniem w komplecie.

Szachy rozwiązały problem uczciwego rankingu dekady temu: oceniaj graczy po tym, kto z kim wygrywa, i śledź, jak bardzo jesteś pewien każdej liczby. DevEval stosuje tę samą matematykę — Glicko-2 — do pracy inżynierskiej. Każdy rating ma poziom pewności i pisemne uzasadnienie, które można audytować.

Mecz

Mecz porównuje pracę dwóch deweloperów z ostatnich 30 dni.

AI czyta niedawną pracę obojga — pull requesty, review, dyskusje — i wydaje werdykt per wymiar oraz ogółem: kto wypadł lepiej, z jaką pewnością i dlaczego. Ten werdykt zasila aktualizację ratingu Glicko-2.

Werdykt meczu Ostatnie 30 dni · Code Quality
Alice wygrywa z Bobem
Code Quality · 87% pewności
Uzasadnienie
  • + Niższa wariancja między PR-ami — jakość trzyma się pod presją terminu
  • + Mniej iteracji review przed merge'em
  • + 5 merytorycznych review vs 1
→ zasila aktualizację ratingu Glicko-2

Zbiorczy dashboard mówi „78 vs 65” — i nie umie powiedzieć dlaczego.

Werdykt wskazuje zwycięzcę, wymiar, pewność i dowody. Nie zgadzasz się z którymś? Otwórz PR-y, które cytuje, i dyskutuj z uzasadnieniem, nie z liczbą.

Matematyka

Glicko-2, nie zwykłe ELO.

Zwykłe ELO daje każdemu liczbę. Glicko-2 mówi dodatkowo, jak bardzo można jej ufać — i to właśnie czyni ranking użytecznym w organizacji, a nie tylko w klubie szachowym.

01 · Niepewność jest pełnoprawną liczbą

Każdy deweloper startuje z maksymalną niepewnością, a nie z fałszywie precyzyjnym ratingiem. System wie, czego jeszcze nie wie — i mówi to wprost.

02 · Każde porównanie zawęża przedział

Każdy werdykt zacieśnia przedział niepewności wokół ratingu. Rating 1500 oparty na kilku porównaniach bezpośrednich nie znaczy tego samego co rating 1500 potwierdzony wieloma takimi porównaniami.

03 · Stabilne po ~10 porównaniach

Ratingi stabilizują się po mniej więcej 10 porównaniach — czyli około dwóch tygodniach normalnej aktywności. Bez półrocznej kalibracji, zanim liczby zaczną coś znaczyć.

04 · Tylko pojedynki, które coś wnoszą

System dobiera wyrównane i porównywalne pary, zamiast zestawiać je losowo. Gdy rating osiągnie wysoki poziom pewności, system ogranicza liczbę porównań, a później okresowo weryfikuje wynik. Dzięki temu ranking pozostaje aktualny.

Trzy perspektywy

Siła względna, pozycja i dostarczona wartość.

DevEval rozdziela trzy pytania, które zbiorczy wynik wrzuca do jednego worka: jak ktoś wypada na tle innych, gdzie znajduje się w organizacji i ile wartości faktycznie dostarczył.

WZGLĘDNY Siła na tle innych

Rating ELO / Glicko-2

Względna siła w każdym wymiarze. Zmienia się po werdyktach z porównań parami, gdy jeden deweloper wypada lepiej od drugiego.

WZGLĘDNY Pozycja w organizacji

Percentyl

Gdzie znajdujesz się w organizacji, na przykład „lepszy niż 87% w jakości kodu”. Odpowiada na pytanie z oceny okresowej w jednej linijce.

ABSOLUTNY Dostarczona wartość w czasie

Punkty absolutne

Ile wartości faktycznie zostało dostarczone. Punkty absolutne nie są grą o sumie zerowej, więc mogą rosnąć w całej organizacji jednocześnie. Pokazują skalę kontrybucji i wspierają oceny kwartalne.

Przykład
Cała organizacja wdraża narzędzia AI. Wszyscy dowożą ~2× szybciej.
Trzy liczby reagują różnie. I o to właśnie chodzi.
ELO Alice
#1 #1
±0
pozycja względna bez zmian
Percentyl Alice
95. 95.
±0
względny, bez zmian
Punkty absolutne Alice
1500 3200
+113%
absolutne, cała organizacja przyspieszyła

Jeden system pokazuje obie odpowiedzi naraz: kto jest najsilniejszy (stabilne) i o ile więcej dowozimy (rośnie). Pojedynczy zbiorczy wynik rozmyłby oba pytania w liczbę, która nie odpowiada na żadne.

Dlaczego parami

Dlaczego werdykty z porównań parami są lepsze niż średnie.

Zbiorcze średnie to powód, dla którego engineering analytics bywa ignorowany. Werdykty są zbudowane tak, żeby dało się z nimi dyskutować — i żeby tę dyskusję przetrwały.

Średnia
Ukrywa powody — 78 to po prostu 78, bierz albo zostaw.
Werdykt
Niesie dowody. Każdy werdykt cytuje PR-y i review, na których stoi — audytowalne PR po PR.
Średnia
Inflacjonuje, gdy narzędzia się poprawiają — nagle „wszyscy są powyżej średniej”.
Werdykt
Ratingi względne zachowują sens również podczas transformacji związanej z AI. Gdy wszyscy przyspieszają dwukrotnie, ranking pozostaje stabilny.
Średnia
Porównuje osoby wykonujące zupełnie inną pracę.
Werdykt
Porównywana jest tylko porównywalna praca. Senior backendu nie jest „rankowany” z onboardingowymi PR-ami stażysty w pojedynku, z którego nic nie wynika.

Uruchom pierwsze porównania na własnym zespole.

Podłącz repozytorium i pozwól ruszyć pierwszym pojedynkom — ratingi stabilizują się w około dwa tygodnie normalnej aktywności.

Wypróbuj bezpłatnie
30 dni · bez karty · anuluj kiedy chcesz
Zamknięta beta · wczesny dostęp

Self-service ruszy niebawem

Priorytetem są teraz wdrożenia enterprise. Zostaw e-mail, a powiadomimy Cię, kiedy self-service ruszy.

Użyjemy tego tylko po to, żeby skontaktować się w sprawie DevEval. Bez newslettera, bez udostępniania osobom trzecim.