Skip to content

Benchmark A/B/C: claim-fähiger Vergleich mit SST_BENCH_BASELINE_COMMAND #10

Description

@Delqhi

Task

Der aktuelle Benchmark läuft nur als SST-only smoke (non-claimable). Für einen claim-fähigen A/B/C-Vergleich müssen folgende Umgebungsvariablen gesetzt werden:

export SST_BENCH_BASELINE_COMMAND='...'
export SST_BENCH_FULL_STACK_COMMAND='...'

Danach:

python3 bin/benchmark-context

Der Benchmark soll messen:

  • Input Tokens
  • Cache Read/Write
  • Output Tokens
  • Laufzeit
  • Erfolgsquote
  • Provider-Versuche
  • Cache-Hits
  • Fehlerstatus

Aktuelle SST-only Ergebnisse (non-claimable):

  • Cold: 4/5 success, median 581ms, ~396 output tokens
  • Warm: 4/5 success, median 185ms, ~389 output tokens

Keine Behauptung wie 'weltweit Platz 1' ohne reproduzierbare Vergleichsdaten.

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions