30. Juli 2026 · Von YasKad
garrytan/gstack

gstack: Eine rollenbasierte Softwarefabrik für Agenten

garrytan/gstack · 134.177★ · 19.991 forks

Alles, was Sie über garrytan/gstack wissen müssen: eine Sammlung von Fähigkeiten und Hilfsprogrammen, die die Arbeit von Programmieragenten als einen Produkt-, Engineering-, Qualitäts- und Veröffentlichungszyklus strukturiert.


Was ist gstack?

gstack ist ein Open-Source-Projekt von Garry Tan, das darauf abzielt, Programmieragenten in eine koordinierte Gruppe von Spezialisten zu verwandeln. Das Repository wird als 23 Tools oder Befehle dargestellt, die hauptsächlich als Markdown-Fähigkeiten geschrieben sind und Funktionen wie Produktmanagement, Architekturprüfung, Design, Codeüberprüfung, Sicherheit, Qualitätskontrolle und Veröffentlichung abdecken.

Es ist weder ein Modell noch ein gehosteter Dienst. Es wird lokal installiert, erkennt verschiedene Agentenumgebungen und stellt Befehle wie /office-hours, /autoplan, /review, /qa, /ship und /land-and-deploy bereit. Das erklärte Ziel ist es, dass eine Person einen vollständigen Prozess durchlaufen kann, anstatt sich nur auf die Anforderung von Codefragmenten von einem Assistenten zu beschränken.

Der Ursprung: Die Veröffentlichung der Arbeitsweise des YC-Präsidenten

Die GitHub-API datiert die Erstellung des Repositorys auf den 11. März 2026. Der Autor, Garry Tan, identifiziert sich in der README-Datei als Präsident und CEO von Y Combinator; sein GitHub-Profil listet Y Combinator als Unternehmen und San Francisco als Standort auf.

Ein einzelner Scheinwerfer beleuchtet eine Werkbank mit 23 Werkzeugsymbolen, während im Hintergrund ein Zitat von Andrej Karpathy als leuchtender Text schwebt

Die Ankündigung stammt aus der README-Datei selbst. Tan beginnt mit einem Zitat von Andrej Karpathy über das Aufhören des manuellen Schreibens von Code und der Fähigkeit von Peter Steinberger, OpenClaw mit Agenten zu erstellen. Daraufhin stellt er gstack als seine praktische Antwort vor: Er öffnet sein eigenes Setup, das er angeblich täglich verwendet, anstatt eine kommerzielle Schicht zu verkaufen. Der Text argumentiert, dass er in 60 Tagen drei Produktionsdienste und mehr als 40 Funktionen bereitgestellt hat, während er Teilzeit an Produkten arbeitete und YC leitete; diese Zahlen sind Behauptungen des Autors und keine unabhängige Prüfung.

Die zentrale Spannung besteht im nativen Einsatz eines Agenten als Textfeld: Tan schlägt verkettete Rollen und Artefakte vor, damit die Sitzung das Problem in Frage stellt, einen Plan schreibt, ihn überprüft, das Ergebnis testet und die Bereitstellung vorbereitet. Er geht auch auf eine übliche Kritik an der KI-gestützten Programmierung ein: Die README-Datei räumt selbst ein, dass nicht normalisierte Codezeilen durch KI aufgebläht werden, und verweist auf seine Methodik, um ein Maß für logische Änderungen zu verteidigen.

Philosophie und Prinzipien

Die leitende Idee wird in der README-Datei als eine Sequenz zusammengefasst: denken, planen, erstellen, überprüfen, testen, veröffentlichen und reflektieren. Jede Fähigkeit liefert ein Artefakt, das die nächste verwenden kann: /office-hours entwirft ein Designdokument, Planüberprüfungen konkretisieren es, /review erkennt Probleme und /ship überprüft vor dem Öffnen einer Pull-Anfrage.

Ein leuchtendes kreisförmiges Diagramm mit den sieben Phasen des Ablaufs — denken, planen, erstellen, überprüfen, testen, veröffentlichen und reflektieren — verbunden durch Datenströme

Seine überprüfbaren Betriebsprinzipien sind:

  • Vage Anfragen umformulieren, bevor Code geschrieben wird, mit Fragen, die Produkt- und Umfangentscheidungen erzwingen.
  • Spezialitäten trennen: Architektur, Design, Entwicklererfahrung, Sicherheit, Tests und Veröffentlichung werden nicht als eine einzige Aufgabe behandelt.
  • Operative Beweise fordern: /qa testet eine Anwendung in einem echten Browser und /ship überprüft Tests und Abdeckung, bevor eine Pull-Anfrage vorbereitet wird.
  • Fehler und Präferenzen in das lokale Gedächtnis überführen: /learn verwaltet Lerninhalte pro Projekt und Sitzung.
  • Sicherheitskontrollen priorisieren, wenn auf Code oder Browser zugegriffen wird: /careful warnt vor destruktiven Operationen und /freeze schränkt die bearbeitbaren Pfade ein.

Es ist eine Methodik mit starken Meinungen, keine Qualitätsgarantie. Seine Ergebnisse hängen von den Modellen, Berechtigungen, Tests, menschlichen Überprüfungen und den Kosten der Aufrufe ab, die jede Installation verwendet.

Wie es funktioniert

Die dokumentierte Basisinstallation klont das Repository und führt ./setup aus; für Claude Code ist der empfohlene Pfad ~/.claude/skills/gstack. Der Team-Modus führt gstack-team-init required aus, schreibt Konfigurationen in .claude/ und CLAUDE.md und überprüft Updates, die auf einmal pro Stunde beschränkt sind. Der Modus optional blockiert diejenigen, die ihn nicht verwenden, nicht.

Der typische Ablauf kann mit /office-hours beginnen, gefolgt von /autoplan oder Planüberprüfungen, der Implementierung der Änderung und dem Abschluss mit /review, /qa und /ship. Einige spezifische Funktionen sind:

Ein holografischer Spezialist sitzt an einem dunklen Glasschreibtisch und projiziert ein Designdokument mit Diagrammen, aufgerufen durch den Befehl /office-hours

BefehlDokumentierte Funktion
/office-hoursFormuliert sechs Produktfragen, stellt Prämissen in Frage und generiert ein Designdokument.
/autoplanVerkettet Überprüfungen von Management, Design und Engineering und überlässt dem Benutzer die Entscheidungen.
/review und /codexÜberprüfen Änderungen; letzteres fordert eine zweite Meinung über die Codex-CLI an.
/qa und /browseÖffnen Chromium, durchlaufen Workflows, erfassen visuelle Tests und generieren Regressionstests bei der Behebung von Fehlern.
/csoWendet eine Sicherheitsüberprüfung basierend auf OWASP Top 10 und STRIDE an.
/ship, /land-and-deploy und /canaryBereiten die Pull-Anfrage vor, warten auf CI und Bereitstellung und überwachen die Anwendung nach der Bereitstellung.
/learn und /retroSpeichern Lerninhalte pro Projekt und führen Engineering-Retrospektiven durch.

Eine robotische Hand bedient ein holografisches Chromium-Browserfenster, während Neon-Markierungen auf visuelle Fehler und Regressionstests hinweisen

Das Projekt dokumentiert auch nützliche Kontrollpunkte für lange Ausführungen: Der optionale Modus für Kontrollpunkte erstellt lokale WIP:-Commits mit Entscheidungen und ausstehenden Aufgaben; /context-restore kann den Zustand wiederherstellen, und /ship komprimiert diese Änderungen vor der Pull-Anfrage. Für mehrere Arbeitsbereiche empfiehlt die README-Datei isolierte Arbeitsbereiche und beschreibt die Verwendung von Conductor für parallele Sitzungen, aber Conductor ist nicht Teil von gstack.

Eine kristalline neuronale Struktur absorbiert Datenfragmente neben einem Retrospektiv-Panel mit Diagrammen und Engineering-Notizen, das /learn und /retro darstellt

Der Installer gibt Kompatibilität mit Claude Code, Codex CLI, OpenCode, Cursor, Factory Droid, Slate, Kiro, Hermes und einem Modus für GBrain an. Die Beitragsdateien geben an, dass Vorlagen für acht Hosts generiert werden: Claude, Codex, Factory, Kiro, OpenCode, Slate, Cursor und OpenClaw. Diese Unterscheidung spiegelt eine sich entwickelnde Dokumentation wider, nicht die Zertifizierung jedes Anbieters.

Offizieller und semioffizieller Status

Es wurden keine Beweise in der README-Datei oder der GitHub-API gefunden, dass gstack als Plugin in einem offiziellen Anthropic-, OpenAI-, Cursor- oder Hermes-Marktplatz akzeptiert wurde. Seine Hauptverteilung ist das Repository selbst und der Installer ./setup.

Es gibt zwei semioffizielle Integrationen im technischen, nicht institutionellen Sinne: Der Installer generiert Fähigkeiten für die kompatiblen Hosts, und die README-Datei gibt vier native OpenClaw-Fähigkeiten an, die über ClawHub installiert werden können (gstack-openclaw-office-hours, gstack-openclaw-ceo-review, gstack-openclaw-investigate und gstack-openclaw-retro). Die Installation einer Fähigkeit über ClawHub ist keine Bestätigung von Anthropic, OpenAI oder einem anderen Hersteller. Mit 125.699 Sternen in der unten gemessenen Metrik und zahlreichen Ableitungen kann es als eine De-facto-Referenz für diesen Stil von Workflows beschrieben werden, aber die abgerufenen Quellen schreiben ihm keinen formalen Standard zu.

Das Ökosystem

Ein zentraler leuchtender Monolith mit der Aufschrift "125k Stars", umgeben von Satellitenknoten, die durch Lichtstrahlen verbunden sind und gbrain, alphaclaw und gstack-auto darstellen

Repositories des Autors

  • garrytan/gbrain: persistente Wissensbasis für OpenClaw- und Hermes-Agenten; gstack enthält /setup-gbrain und /sync-gbrain, um sie zu initialisieren und Repositorys zu indizieren. In der abgerufenen API hatte es 27.538 Sterne und 4.036 Forks.
  • garrytan/gbrain-evals: Repository mit Bewertungen desselben Autors, mit 329 Sternen und 57 Forks in der Liste der Repositories seines Kontos.
  • garrytan/alphaclaw: Installationsharness für OpenClaw, mit 142 Sternen und 29 Forks.
  • garrytan/openclaw-render-template: Vorlage für die Bereitstellung von OpenClaw in Render, mit 15 Sternen und 5 Forks.

GBrain ist die engste funktionale Verbindung: Die README-Datei von gstack ermöglicht die Verwendung von lokalem PGLite, Supabase oder einem Remote-MCP-Server, um das Gedächtnis zu speichern, und definiert Richtlinien pro Repository für Lese-/Schreib-, Nur-Lese- oder Ablehnungszugriff.

Community-Forks, Ports und Erweiterungen

  • XLearnity/gstack ist der bemerkenswerteste Fork, den die API der Forks zurückgab: 111 Sterne und 8 Forks.
  • kimjin8/gstack-antigravity portiert gstack zu Google Antigravity: 42 Sterne und 6 Forks.
  • bulyaki/gstackplusplus passt den Ansatz an die C++-Entwicklung an: 20 Sterne und 8 Forks.
  • TMFNK/gstack-OpenCode ist ein Adapter für OpenCode mit 21 Engineering-Fähigkeiten: 5 Sterne.
  • fustackat/gstack-skill-translations-zh-tw wird in der GitHub-Suche als Übersetzung von Fähigkeiten ins traditionelle Chinesisch identifiziert: 0 Sterne in der Abfrage. Es handelt sich um eine Community-Übersetzung, nicht vom ursprünglichen Autor.
  • loperanger7/gstack-auto schlägt eine halbautomatische Orchestrierung basierend auf gstack vor: 243 Sterne und 24 Forks.
  • mr-daedalium/ostack-saas wird als Fork von gstack für ein KI-gestütztes Engineering-Team deklariert: 107 Sterne und 19 Forks.
  • fagemx/gstack-game passt die Methodik an die Spieleproduktion an: 55 Sterne und 5 Forks.
  • MikeChongCan/cfo-stack wendet die Idee auf Buchhaltung und persönliche Finanzen an: 50 Sterne und 11 Forks.

Diese Beziehungen stammen aus den Metadaten und Beschreibungen von GitHub, die in dieser Recherche abgerufen wurden. Sie beweisen keine gemeinsame Wartung, aktuelle Kompatibilität oder Unterstützung durch Garry Tan für jede Ableitung.

Repository-Zahlen

Messung: 1. August 2026, GitHub-API.

MetrikWert
Sterne125.699
Forks18.854
Echte Abonnenten769
Commits360
Angegebene offene Issues in der API860
HauptspracheTypeScript
LizenzMIT
Erstellung11. März 2026
Letzter Commit im Repository15. Juli 2026
Letztes Update der Metadaten1. August 2026
Letzte dokumentierte Version1.60.1.0, 9. Juli 2026
GitHub-Postskeine im abgefragten Endpunkt

Die wichtigsten Mitwirkenden in der API-Antwort waren garrytan (319 Beiträge), test22345 (17), 16francej (7) und time-attack (6). Die Gesamtzahl von 360 Commits stammt vom letzten Paginierungslink der API. watchers_count repliziert die Anzahl der Sterne in der allgemeinen GitHub-Antwort; daher wird subscribers_count als echte Abonnenten angegeben. Das Feld open_issues_count kann offene Pull-Anfragen enthalten, so dass 860 nicht unbedingt eine exklusive Zählung von Issues ist.

Wie man beiträgt

Die CONTRIBUTING.md-Datei dokumentiert einen detaillierten Beitragsablauf. Das vollständige Repository sollte geklont werden, und dann werden bun install und bin/dev-setup ausgeführt, wodurch der Arbeitsbaum verknüpft wird, so dass Claude Code lokale Änderungen sofort testen kann. Das Dokument empfiehlt einen vollständigen Fork, nicht eine flache Klonung, um git log, git blame und git bisect zu ermöglichen.

Die Fähigkeiten werden aus den Vorlagen SKILL.md.tmpl bearbeitet, nicht aus den generierten Markdown-Dateien. Der angegebene Ablauf ist die Änderung der Vorlage, die Ausführung von bun run gen:skill-docs --host all, die Überprüfung mit bun run skill:check, das Testen der Fähigkeit in realer Arbeit und das Öffnen einer Pull-Anfrage aus einem Fork.

Ein mechanischer Arm fügt SKILL.md.tmpl-Dateien in einer leuchtenden Fertigungslinie zusammen, während ein Terminal im Vordergrund den Befehl ./setup ausführt

Das Projekt definiert drei Teststufen: bun test für kostenlose statische Validierung; bun run test:e2e für eine vollständige Ausführung mit claude -p; und bun run test:evals, die eine vollständige Ausführung und Bewertung durch ein Modell kombiniert. Die Anleitung warnt davor, dass die letzten beiden API-Aufrufe verursachen, und dass die Bewertungs-Child-Prozesse in einer isolierten Umgebung ausgeführt werden, um zu verhindern, dass lokale Konfigurationen, MCPs oder Speicher das Ergebnis beeinflussen. Eine GitHub-Aktion überprüft bei jedem Push und jeder Pull-Anfrage, ob die generierte Fähigkeitendokumentation aktuell ist.

Wie die Community es aufgenommen hat

Die abgerufene Reaktion vermischt Interesse an dem disziplinierten Ablauf mit starken Einwänden gegen seine Metriken, Kosten und Autonomie:

  • Der Hauptthread von Hacker News, 47418576, wurde am 17. März 2026 von alienreborn gepostet. Die abgerufene Algolia-API weist ihm 74 Punkte zu; der Referenzkommentar in einem anderen Post gibt 87 Kommentare an, aber der Detailendpunkt gab keine Kommentaranzahl zurück und daher wird diese Zahl nicht als bestätigte Messung angegeben. josh2600 lobte, dass die Entwürfe von Antworten auf Produkt- und Engineeringfragen ihre Qualität und Entwicklungsgeschwindigkeit verbessert haben. Im Gegenzug hielt MaxLeiter den Planungsmodus für interessant, obwohl er viele Token verbraucht; rileymichael stellte in Frage, ob Codezeilen eine nützliche Metrik sind, und input_sh fragte nach den monatlichen API-Kosten und möglichen Rabatten. Dies sind die Meinungen der Teilnehmer, nicht unabhängige Messungen.
  • Im selben Thread bezeichnete observationist es als ein leistungsstarkes Setup, räumte aber ein, dass es bessere, maßgeschneiderte Tools für bestimmte Aufgaben gibt. Diese Kritik betrifft den Umfang: Das Projekt kombiniert viele Funktionen und ist möglicherweise nicht die einfachste Option für ein isoliertes Problem.
  • Der Post 47668746, veröffentlicht von thisisfatih, stellt tonone-ai/tonone als von gstack inspiriert dar. Er erhielt 3 Punkte und 1 Kommentar. Der Autor gab an, dass die Zuweisung einer einzigen Funktion zu jedem Agenten den Kontext und den Tokenverbrauch reduziert und die Ausgabe verbessert; dies ist ein Beweis für eine inspirierte Erweiterung, nicht für eine kontrollierte Bewertung von gstack.
  • Der Post 47355173 von jumploops erreichte 15 Punkte und 15 Kommentare gemäß der Algolia-Suche. zippolyon fasste die betriebliche Reserve klar zusammen: Geschwindigkeit ohne Grenzen ist gefährlich, wenn ein Agent autonom zwischen Repositories arbeitet. Dieser Benutzer verlinkte als Antwort sein eigenes Produkt, so dass dies als eine interessierte Empfehlung und nicht als Beweis für einen Fehler von gstack gelesen werden sollte.

Eine neonfarbene KI-Entität scannt einen schwebenden Codeblock, während rote Warnglyphen und holografische Schilde auf OWASP- und STRIDE-Befunde hinweisen

gstack im Vergleich zu anderen Vorschlägen

VorschlagÜberprüfbare ÜbereinstimmungÜberprüfbare Unterschiede
tonone-ai/tononeDer Autor gibt an, dass er sich von gstack inspirieren ließ und Agenten ebenfalls nach Funktionen organisiert.Der Tonone-Autor behauptet, Produkt- und Engineeringteams mit Verantwortlichen und Subagenten sowie einem eigenen Marktplatz erstellt zu haben; gstack wird als lokale Fähigkeiten und Hilfsprogramme verteilt.
browser-use/browser-harness-jsBeide ermöglichen es einem Agenten, über das DevTools-Protokoll mit Chrome zu interagieren.Die README-Datei von gstack stellt dies als eine schlanke, zustandslose Alternative dar; gstack verwendet eine Whitelist, gegenseitige Sperrung und einen nicht vertrauenswürdigen Ausgabewrapper für sensible Operationen.
forrestchang/andrej-karpathy-skillsDas README von gstack zitiert es als Regelwerk für Fehler in der KI-gestützten Programmierung.gstack positioniert sich als Schicht, die während eines Sprints einen mehrstufigen Ablauf erzwingt, während das README dem anderen Projekt nur Regeln zu Annahmen, Komplexität, fremden Änderungen und deklarativen Zielen zuschreibt.
loperanger7/gstack-autoErklärt eine auf gstack basierende Orchestrierung.Es wird als halbautonome Erweiterung präsentiert, die von einer Spezifikation ausgeht; es ist weder das ursprüngliche Repository noch eine verifizierte offizielle Integration.

Der praktische Unterschied liegt nicht nur in der Anzahl der Agenten: gstack versucht, Entscheidungen, Tests, Qualitätskontrolle und Veröffentlichung durch Statusdateien und Befehle zu verknüpfen. Ein Browser-Tool oder eine Regelbibliothek kann besser geeignet sein, wenn nur eine dieser Schichten benötigt wird.

Anwendungsfälle und wer von diesem Repository profitieren kann

  • Personen, die Agenten verwenden, um eine Funktion von der Idee bis zur Auslieferung zu bringen, können /office-hours verketten, um das Produkt zu klären, /autoplan, um den Plan zu überprüfen, /review, um Änderungen zu inspizieren, /qa, um die Anwendung in Chromium zu durchlaufen, und /ship, um den Status zu überprüfen, bevor eine Pull-Anfrage geöffnet wird.
  • Teams, die Kontrollen bei langen Arbeiten sichtbar machen möchten, können Kontrollpunkte WIP: und /context-restore verwenden, um Entscheidungen und ausstehende Arbeiten wiederherzustellen. In Bereitstellungsabläufen wartet /land-and-deploy auf CI und Bereitstellung, während /canary die Anwendung danach überwacht; /careful und /freeze bieten Einschränkungen für sensible Operationen.
  • Verantwortliche für Dokumentation und projektbezogenes Lernen können /document-release verwenden, um Änderungen mit README, Architektur und Leitfäden abzugleichen, /document-generate, um Dokumentation mit Diataxis zu strukturieren, und /learn oder /retro, um Muster und Probleme pro Projekt zu bewahren. Die Fähigkeitsvorlagen selbst können mit bun run skill:check, vollständigen Tests und Bewertungen durch ein Modell validiert werden.

gstack organisiert eine Arbeitsmethode und ihre lokalen Artefakte; es ersetzt weder Branch-Schutzmaßnahmen noch CI/CD-Richtlinien noch die Überprüfung von Berechtigungen. Vollständige Ausführungen und Bewertungen verbrauchen API-Aufrufe, daher ist es ratsam, Kosten und Ergebnisse zu messen, bevor der Ablauf auf ein ganzes Team ausgeweitet wird.

Ressourcen


Hinweis: Dieser Artikel kombiniert das README, den Beitragsleitfaden und die Änderungshistorie von gstack, die GitHub-API und Hacker News, abgerufen am 1. August 2026. Die Zahlen ändern sich mit der Zeit.

Kommentare