Handoff-Benchmark
Eine reproduzierbare Baseline für toolübergreifende Arbeitskontinuität mit Palim.
Palim misst hier zunächst die technische Grundlage einer Übergabe: Ein in Claude, Cursor oder Codex gespeicherter Arbeitsstand muss in einem anderen Client über palim_resume wieder erscheinen — ohne Session-ID, Transkript oder manuelles Einfügen.
Reproduzierbarer Lauf
Der Runner liegt mit seinen drei synthetischen Fixtures im öffentlichen Repository. Er prüft, ob palim_resume den neuesten Thread und dessen offene Aufgabe zurückliefert. Zusätzlich gibt er mittlere Antwortgröße, geschätzte Token und Abrufzeit aus.
cd palim-mcp
npm run eval:handoffDer aktuelle Baseline-Lauf liefert 3 von 3 Übergaben, eine mittlere Ausgabe von 874 Zeichen beziehungsweise geschätzten 219 Token und 0,02 ms Abrufzeit im Prozess.
Aussagegrenze
Das ist eine deterministische Transport- und Kontextbudget-Messung. Sie behauptet weder, dass ein Sprachmodell die Aufgabe richtig erledigt, noch einen Vergleich ohne Palim. Dafür braucht es einen festgelegten Modellstand, Prompt, Bewertungsraster und unabhängige Test-Sessions.
LoCoMo bleibt eine getrennte Frage-Antwort-Messung. Palim veröffentlicht dafür erst eine Zahl, wenn Datensatz, Umgebung und vollständiger Lauf dokumentiert sind.
Zuletzt aktualisiert am