CrazyJev Lab

So nutzt Room Rush Jev: vom Seitenzustand zum bestätigten Fund

CrazyJev ·

Room Rush gibt Jev 75 Sekunden für die Produktsuche bei IKEA. Ein Browser liest die Seite, Jev wählt eine erlaubte Aktion, und der Runner prüft das Ergebnis. Es gibt weder Bestellung noch Zahlung. CrazyJev ist unabhängig von IKEA und TypeSafe AI.

Zustand → Entscheidung → Aktion → Bestätigung

Der Zustand enthält sichtbare Kandidaten, Raumthema, bereits gesammelte Produkte und Restzeit. Erst nach Prüfung der Modellauswahl führt der Browser eine Suche, einen Seitenwechsel, Scrollen oder das Hinzufügen aus. Du siehst den Ablauf auf dem Computer im Zimmer.

Ein Klick allein zählt nicht als Fund. Der Runner muss den Einkaufszustand bestätigen. Der Browserstart liegt vor dem 75-Sekunden-Fenster. Seitenladezeit, Netzwerk und Modellentscheidung sind unterschiedliche Zeitspannen.

Was gezählt wird

Die Produktzahl umfasst unterschiedliche bestätigte Artikel im Serverbeleg. Entscheidungen sind gültige, geprüfte Aktionswahlen; Wiederholungsversuche zählen nicht automatisch zusätzlich. Fehlende Messwerte erscheinen als nicht erfasst, nie als Null.

Ein abgelaufener Timer kann null Produkte ergeben. Eine wirksame Nutzung im Wachstumstrichter setzt mindestens einen bestätigten Fund und eine tatsächlich angezeigte Ergebnisseite voraus. Abbruch und Fehler bleiben getrennt.

Starte eine Runde und vergleiche Bildschirm, Timer und Liste. Geteilte Ergebnisse bleiben 90 Tage öffentlich, ohne persönliche Notiz oder privaten Bildzugang. Dasselbe Thema übernimmt Raum und Seed, garantiert aber keine identischen Produkte. Bei eigenen Raumwünschen muss der nächste Spieler seine eigene Beschreibung eingeben.

Kosten und Grenzen

Ein durch Rechnungen belegter Preis pro Runde liegt hier noch nicht vor. Modellversuche, Browserlaufzeit, Speicherung und optionale Bildgenerierung müssen getrennt erfasst werden. Entscheidungen mal angenommener Stückpreis reichen nicht aus.

Eine Untersuchung muss Version, Anbieter, Modell, Region, Datum und alle Versuche einschließlich Fehlern und leeren Ergebnissen dokumentieren. Generierte Raumbilder sind Ideen, keine vermessenen Pläne oder Kaufbelege. Dieser Artikel erklärt die Implementierung; er belegt weder allgemeine Erfolgsquote noch Durchschnittskosten oder einen Geschwindigkeitsvorteil.

Reaction-Messmethode

Beobachtungen aus der Entwicklung: 20. September 2026

Wir haben 11 echte Versuche gespeichert: 4 endeten mit bestätigten Produkten, 2 ohne Produkte, 3 mit Fehlern und 2 wurden durch Neuladen während der Entwicklung unterbrochen. Die vier Belege mit Produkten enthielten jeweils 1–2 Artikel und 6–10 gültige Entscheidungen bei einem Einkaufsfenster von 75 Sekunden. Für alle vier wurde lokal ein öffentlicher Ergebnisdatensatz erstellt.

Next.js und Wrangler-Speicher liefen lokal; Cloudflare stellte den echten Remote-Browser bereit, Jev wurde über Vercel AI Gateway aufgerufen. Der Code wurde während der Fehlersuche geändert; Hashes der jeweiligen Änderungen fehlen. Dies ist kein Benchmark einer festen Version und keine Schätzung der Zuverlässigkeit im Produktivbetrieb. Alle Versuche bleiben im Nenner. Abgerechnete Kosten sind unbekannt.

Die letzten drei Versuche endeten zweimal leer und einmal mit einem Browser-Timeout. Deshalb wurde die Sammlung vor den geplanten 20–30 Versuchen gestoppt. Bei fehlgeschlagenen Bestätigungen zeigten Aufnahmen einen noch ladenden Warenkorb; ein Klick wurde nicht als Erfolg gezählt. Vor weiteren Messungen muss das Laden der Seiten untersucht werden. Bereinigte Beobachtungen herunterladen.

Nachtrag: alle 21 Entwicklungsversuche

Über alle Debugging-Batches hinweg wurden 21 Versuche gespeichert: 10 mit Produkten abgeschlossen, 2 leer abgeschlossen, 7 fehlgeschlagen und 2 unterbrochen. Die nicht leeren Belege enthalten 1–3 Produkte und 6–11 gültige Entscheidungen. Für alle zehn wurde lokal ein öffentlicher Ergebnisdatensatz erstellt. Spätere Batches enthalten Quellcode-Hashes; während des letzten Laufs wurde die ursprüngliche Startseitenpositionierung wiederhergestellt, weshalb dieser Lauf als geändert markiert ist. Mehrere Entwicklungsversionen sind enthalten: kein Benchmark einer festen Version. Die ersten elf Versuche bleiben separat verfügbar.

Alle 21 bereinigten Datensätze herunterladen.