PalimDocs

Handoff-Benchmark

Eine reproduzierbare Baseline für toolübergreifende Arbeitskontinuität mit Palim.

Palim misst hier zunächst die technische Grundlage einer Übergabe: Ein in Claude, Cursor oder Codex gespeicherter Arbeitsstand muss in einem anderen Client über palim_resume wieder erscheinen — ohne Session-ID, Transkript oder manuelles Einfügen.

Reproduzierbarer Lauf

Der Runner liegt mit seinen drei synthetischen Fixtures im öffentlichen Repository. Er prüft, ob palim_resume den neuesten Thread und dessen offene Aufgabe zurückliefert. Zusätzlich gibt er mittlere Antwortgröße, geschätzte Token und Abrufzeit aus.

cd palim-mcp
npm run eval:handoff

Der aktuelle Baseline-Lauf liefert 3 von 3 Übergaben, eine mittlere Ausgabe von 874 Zeichen beziehungsweise geschätzten 219 Token und 0,02 ms Abrufzeit im Prozess.

Aussagegrenze

Das ist eine deterministische Transport- und Kontextbudget-Messung. Sie behauptet weder, dass ein Sprachmodell die Aufgabe richtig erledigt, noch einen Vergleich ohne Palim. Dafür braucht es einen festgelegten Modellstand, Prompt, Bewertungsraster und unabhängige Test-Sessions.

LoCoMo bleibt eine getrennte Frage-Antwort-Messung. Palim veröffentlicht dafür erst eine Zahl, wenn Datensatz, Umgebung und vollständiger Lauf dokumentiert sind.

Zuletzt aktualisiert am