Pathway: un marco de datos en vivo para ETL, analítica en tiempo real y RAG
pathwaycom/pathway · 62.241★ · 1.681 forks
Todo lo que hay que saber sobre pathwaycom/pathway: un marco ETL de Python cuyo motor en Rust ejecuta el mismo código tanto para lotes como para flujos, con una extensión para tuberías de LLM y RAG. El informe se centra en el repositorio y en su organización, que en 2025-2026 ha reenfocado su imagen pública hacia una arquitectura de IA «post-transformer» (BDH).
Qué es Pathway
Pathway Live Data Framework (abreviado en el código como pw) es un marco ETL de Python para procesamiento de flujos, analítica en tiempo real, tuberías de LLM y RAG. No es un motor de base de datos ni un servicio: es una librería de Python que el usuario escribe como código normal y que un motor de Rust ejecuta.
La premisa central, verificable en el README, es la unificación de lote y flujo: el mismo código sirve para desarrollo local, pruebas de CI/CD, trabajos por lotes, relectura de un flujo y procesamiento de un flujo en vivo. El motor está basado en Differential Dataflow y realiza cómputo incremental, por lo que cuando cambia un dato el marco solo recalcula lo que se ve afectado.
El producto incluye tres bloques: un conector a las fuentes, transformaciones (con y sin estado: joins, ventanas, ordenamientos) y una extensión LLM con utilidades (wrappers, parsers, embedders, splitters) y un índice vectorial en memoria en vivo, con integraciones documentadas para LangChain y LlamaIndex.

Origen
El repositorio fue creado el 27 de noviembre de 2022 bajo la organización pathwaycom. La empresa es Pathway, con sede en Polonia. Los tres fundadores que lista la web oficial son:
- Zuzanna Stamirowska, CEO. Doctora en sistemas complejos, graduada de la École Polytechnique, con modelos de predicción de redes publicados en la National Academy of Sciences.
- Jan Chorowski, CTO. Exinvestigador de MILA y de Google Brain (bajo Samy Bengio), coautor de trabajo con Geoffrey Hinton y de los modelos de atención tempranos, coautor de la librería Theano; la web cita más de 12.000 citas e índice h de 24. Su nombre de usuario de GitHub,
janchorowski, es el autor de los Show HN del proyecto. - Adrian Kosowski, CSO. Doctor en algoritmos, exInria, más de 100 artículos, índice h de 29; coautor del paper de BDH.
La cronología verificable de la organización, según su propio blog y prensa: una ronda de 10 millones de dólares (TechCrunch, 29 de noviembre de 2024); reconocimiento como «Emerging Visionary» en GenAI de Gartner (noviembre de 2024); una asociación declarada con AWS y NVIDIA para entregar sistemas de IA adaptativos (businesswire, 1 de diciembre de 2025); y una valoración de 500 millones de dólares anunciada a inicios de agosto de 2025.
El color narrativo más notable es un giro de identidad: el repositorio es un marco de datos/ETL/RAG, pero la portada de pathway.com hoy se presenta como «Intelligence with no ceiling», un laboratorio de IA de frontera que desarrolla BDH (Dragon Hatchling), una arquitectura recurrente «post-transformer» inspirada en el cerebro. El paper, «The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain» (arXiv 2509.26507, 2025), lleva firma de Kosowski, Uznański, Chorowski, Stamirowska y Bartoszkiewicz. El blog afirma que BDH fue el segundo paper de IA más popular de 2025. Este doble enfoque —datos en vivo por un lado, investigación de arquitecturas por otro— es la tensión real del proyecto: el marco ETL sigue siendo el producto instalable y con código, mientras que BDH es la apuesta de investigación que capta la prensa (WSJ, Forbes, MIT Technology Review, Live Science, Semafor).
Filosofía y principios
Del README y de la documentación se extraen estos principios, todos verificables en el texto oficial:
- Un solo código para lote y flujo: la misma definición de tubería se ejecuta local, en pruebas, por lote, en relectura y en vivo.
- Cómputo incremental: el motor no recalcula todo cuando llega un dato; actualiza solo lo derivado (base de Differential Dataflow).
- Python para la lógica, Rust para la ejecución: el usuario escribe Python (y puede llamar a cualquier librería Python), pero el motor Rust habilita multihilo, multiproceso y cómputo distribuido, esquivando el límite de un solo hilo de Python.
- La persistencia y la consistencia como servicio: el marco guarda el estado para reiniciar tras una actualización o un fallo, y gestiona el tiempo, actualizando resultados cuando llegan datos tardíos o desordenados.
- RAG «en vivo»: el índice vectorial se construye y mantiene a medida que cambian los documentos, de modo que las respuestas de un RAG reflejan el estado actual de la fuente.

Cómo funciona
El patrón básico documentado (del ejemplo del README) es:
pw.io.<fuente>.read(...)conecta a la fuente y devuelve una tabla (con unpw.Schemaopcional que tipa las columnas).- Se encadenan transformaciones sobre la tabla:
.filter(...),.reduce(...)conpw.reducers.*, joins, ventanas, o cualquier función de Python. pw.io.<destino>.write(tabla, ...)carga el resultado a un sistema externo.pw.run()arranca el cómputo.
El proyecto se ejecuta como un guion de Python normal: python main.py. El marco arranca un panel de monitoreo (mensajes por conector, latencia y logs). Alternativas de arranque documentadas: pathway spawn python main.py y, para multihilo, pathway spawn --threads 3 python main.py.

El motor mantiene la tubería en memoria. La versión libre da una garantía de consistencia «al menos una vez»; la versión de empresa da «exactamente una vez». En la publicación v0.32.1 (1 de agosto de 2026) se añadieron, entre otros, los conectores de escritura pw.io.chroma.write y pw.io.qdrant.write, que mantienen una colección de base vectorial sincronizada con la tabla.

La extensión LLM (llamada LLM xpack en la documentación) agrega wrappers de servicios LLM, parsers, embedders, splitters, un índice vectorial en memoria en vivo y las integraciones con LangChain y LlamaIndex. Los modelos listados de la web como «Colaboraciones destacadas» incluyen Databento, LangChain, LlamaIndex, MinIO, PaddleOCR y Redpanda.

El ecosistema
Repositorios de la organización pathwaycom
pathwaycom/llm-app: plantillas de aplicaciones listas para desplegar (RAG, búsqueda empresarial, pipelines de IA) sobre el marco; 58.937 estrellas y 1.479 bifurcaciones. Es el hermano más grande y es donde vive el catálogo de plantillas: Question-Answering RAG App, Live Document Indexing, Multimodal RAG con GPT-4o, Unstructured-to-SQL, Adaptive RAG App, Private RAG con Mistral y Ollama, Slides AI Search y Video RAG con TwelveLabs. El README de ese repositorio indica que el índice vectorial por defecto usa usearch y los índices híbridos de texto completo usan Tantivy, y que sustituyen módulos separados de base vectorial (Pinecone/Weaviate/Qdrant), caché (Redis) y framework de API (FastAPI).pathwaycom/arc-task-gen: genera tareas nuevas de estilo ARC-AGI-1 para evaluar modelos como BDH-CQ; 10.625 estrellas y 68 bifurcaciones.pathwaycom/bdh: implementación oficial de la arquitectura Dragon Hatchling (el paper de 2025); 3.545 estrellas y 252 bifurcaciones.pathwaycom/pathway-benchmarks: benchmarks contra Spark, Flink y Kafka Streams; 302 estrellas y 12 bifurcaciones.pathwaycom/cookiecutter-pathway: plantilla para arrancar proyectos de Pathway listos para producción; 277 estrellas y 17 bifurcaciones.pathwaycom/serviette: herramienta de RAG descrita como «Universal RAG tool»; 4 estrellas.

Repositorios relacionados fuera de la organización
pathway-labs/pathway-examples: ejemplos de código del marco; 43 estrellas y 6 bifurcaciones (pertenecen a una organización distinta,pathway-labs, no apathwaycom).xyphoes0727/FraudDetection(5 estrellas): un pipeline de detección de fraude en tiempo real construido con Pathway, ejemplo de adopción comunitaria.
Bifurcaciones
Las bifurcaciones con más estrellas del repositorio principal tienen pocas estrellas (máximo 6, p. ej. sheikhsajid69/pathway), lo que sugiere que el ecosistema crece más por los repos hermanos oficiales y por plantillas que por forks independientes del núcleo. No se encontró, en la búsqueda realizada, una traducción comunitaria al español u otro idioma del marco.
Estado oficial / semioficial
Pathway es un producto con respaldo de proveedores y reconocimientos de terceros, no un estándar abierto nombrado:
- Gartner lo reconoció como Emerging Visionary en GenAI (noviembre de 2024).
- Existe una asociación declarada con AWS y NVIDIA para sistemas de IA adaptativos y de aprendizaje continuo (businesswire, 1 de diciembre de 2025).
- El README lista colaboraciones e integraciones con Databento, LangChain, LlamaIndex, MinIO, PaddleOCR y Redpanda. LangChain y LlamaIndex documentan a Pathway como integraciones (vector store / retriever).
- El proyecto aparece en listas curadas como
vinta/awesome-python(entrada «pathway», línea 497 del README de esa lista).
Lo que esto significa en la práctica: Pathway es una opción instalable y documentada dentro de los ecosistemas de LangChain y LlamaIndex, y una alternativa comercial a los motores de streaming maduros (Flink, Spark, Kafka Streams) con un punto diferencial en RAG en vivo. No hay, en las fuentes consultadas, una designación formal de «estándar de facto»; su posición es la de un proveedor vertical (datos en vivo + RAG + IA) con tracción de prensa y de partners.

Guía rápida de uso
Instalación y primer arranque
Prerrequisitos: Python 3.10 o superior y macOS o Linux (el README indica que en otros sistemas conviene usar una máquina virtual).
pip install -U pathway
El ejemplo mínimo documentado (sumar valores positivos en tiempo real) es:
import pathway as pw
class InputSchema(pw.Schema):
value: int
input_table = pw.io.csv.read("./input/", schema=InputSchema)
filtered_table = input_table.filter(input_table.value >= 0)
result_table = filtered_table.reduce(
sum_value = pw.reducers.sum(filtered_table.value)
)
pw.io.jsonlines.write(result_table, "output.jsonl")
pw.run()
Al ejecutar python main.py se abre un panel de monitoreo con mensajes por conector, latencia y logs. Para arrancar con un número concreto de hilos: pathway spawn --threads 3 python main.py. Hay un notebook en Google Colab enlazado desde el README y más ejemplos en examples/.
Flujos de trabajo habituales
- ETL en tiempo real desde Kafka: se define una tubería que lee un tema Kafka, transforma y escribe a un destino; el README enlaza la plantilla
kafka-etly la guía «Switch from batch to streaming». El resultado es una pipeline que, al llegar un nuevo mensaje, actualiza solo los cálculos afectados. - RAG privado y autocontenido: desde
pathwaycom/llm-app, la plantilla Private RAG con Mistral y Ollama corre localmente; al sincronizar con una carpeta/Google Drive/SharePoint, el índice se actualiza en vivo y las respuestas reflejan los documentos más recientes. - Unstructured-to-SQL: la plantilla
unstructured_to_sql_on_the_flylee PDFs financieros, los estructura en SQL, carga a PostgreSQL y responde consultas en lenguaje natural traduciéndolas a SQL. - Ejecución en Docker: para un guion de un solo archivo,
docker run -it --rm --name my-pathway-app -v "$PWD":/app pathwaycom/pathway:latest python my-pathway-app.py.

Configuración esencial
pw.Schema: tipa las columnas de una tabla; opcional pero recomendado para validación.- Conectores
pw.io.*: elige la fuente/destino (csv,jsonlines,kafka,postgresql,gdrive,chroma,qdrant, entre otros); son la primera cosa que se toca. pathway spawn --threads N: controla el paralelismo multihilo local.- Backend de persistencia: el backend de estado (S3 o archivo local) se elige por parámetro de configuración del código, según lo aclarado por el equipo en el hilo de Hacker News.
- Plantillas de
llm-app: para RAG, se parte de una plantilla y se cambia la fuente o el tipo de índice (vectorial → híbrido) con «un cambio de una línea», según su README.
Trampas frecuentes y soluciones
- Sistemas no soportados: el README advierte que Pathway está disponible solo para macOS y Linux; en otros entornos se recomienda una máquina virtual.
- Consistencia: la versión libre da «al menos una vez»; si se requiere «exactamente una vez» hace falta la versión de empresa. Es un límite de licencia, no un bug.
- Requisito de RAM en producción: el equipo aclaró en el hilo de Hacker News que el factor dominante del consumo de RAM es el tamaño de los datos que se alimentan, especialmente con un índice en memoria. La pregunta de un usuario sobre el plan «Community 8 GB / 4 núcleos» quedó sin una cifra concreta de requisitos mínimos publicada en las fuentes recuperadas.
- Bifurcaciones grandes: el CONTRIBUTING indica que un PR sustancial sin aprobación previa de un mantenedor puede cerrarse sin revisión detallada; para contribuciones grandes conviene abrir primero un issue.
Integraciones y migración
- LangChain / LlamaIndex: Pathway se integra como vector store / retriever (documentado en ambos ecosistemas); las plantillas de
llm-appactúan como backend de recuperación para aplicaciones de LangChain o LlamaIndex. - Bases vectoriales:
pw.io.chroma.writeypw.io.qdrant.write(v0.32.1) escriben la tabla a Chroma/Qdrant manteniendo la colección sincronizada. - Streaming: conectores para Kafka (y, por extensión, ecosistemas de streaming como Redpanda) y el conector Airbyte para más de 300 fuentes.
- Despliegue: Docker (imagen
pathwaycom/pathway:latest), Kubernetes y nubes; hay una guía de despliegue en Render en la documentación. - Migración desde bases vectoriales/caché/API separadas: el README de
llm-appenmarca a Pathway como la sustitución de un stack de módulos separados (vector DB + Redis + FastAPI) por un solo marco con índice vectorial (usearch) y texto completo (Tantivy) integrados.
Métricas actuales
Medición: 5 de septiembre de 2026, API de GitHub.
| Métrica | Valor |
|---|---|
| Estrellas | 62.344 |
| Bifurcaciones | 1.687 |
| Suscriptores | 120 |
| Incidencias abiertas indicadas por la API | 35 |
| Commits | ≈2.233 |
| Lenguaje principal | Python |
| Licencia | BSL 1.1 («Other» en la API) |
| Rama por defecto | main |
| Creación | 27 de noviembre de 2022 |
| Última publicación | v0.32.1, 1 de agosto de 2026 |
Los principales contribuidores devueltos por la API, por número de contribuciones, fueron Pathway-Dev (837), zxqfd555 (436), pw-ppodhajski (136), szymondudycz (123), olruas (122), KamilPiechowiak (113) y berkecanrizai (92). El conteo de ≈2.233 commits proviene de la página final del enlace de paginación de la API de commits. watchers_count de la respuesta general replica el número de estrellas, y open_issues_count (35) puede incluir solicitudes de cambios abiertas. En PyPI, la versión actual es 0.32.1 con 80 versiones publicadas y requires_python >=3.10; pypistats reportó 172 descargas en el último día, 927 en la semana y 7.273 en el mes. En Docker Hub, la imagen pathwaycom/pathway registró 14.000 descargas acumuladas y 2 estrellas (última actualización 31 de julio de 2026).
Recepción de la comunidad
La evidencia recuperada muestra interés concreto, especialmente en RAG en vivo, y preguntas prácticas del equipo:
- En el hilo de Hacker News 40669434 —«Show HN: Pathway – Build Mission Critical ETL and RAG in Python (NATO, F1 Used)», publicado el 13 de junio de 2024 por
janchorowski(CTO)— se alcanzaron 73 puntos. Entre los comentarios verificados: pipboyguy escribió «I’ve built DE and AI solutions based on Pathway for multiple clients. It’s robust and fast» (evidencia de uso profesional, no una evaluación independiente); snowpid comentó irónicamente sobre el uso corporativo («Good old “Enterprise” NATO!»); Arimbr preguntó si, al mantenerse todo en memoria, Pathway persiste estado en algún sitio; threecheese preguntó por el plan «Community 8 GB RAM / 4 núcleos» y si hay algo que se hospede siempre; sriyansh7 preguntó qué casos de uso ve para RAG sobre datos en flujo. - Respondieron miembros del equipo:
dxtrous(Adrian, de Pathway) aclaró que todo es RAM-based y que la persistencia/caché se apoya en backends de archivo (S3 o local) configurables, que el consumo de RAM depende sobre todo del tamaño de los datos (sobre todo con índice en memoria), y que el dominio sigue siendo mayormente datos no estructurados (mensajería, índice en vivo de comunicaciones, redes sociales, noticias).janchorowskiagradeció y pidió detalles de casos de uso. - Otros Show HN del proyecto, con tracción menor: 39852514 «Adaptive RAG – How we cut LLM costs without sacrificing accuracy» (8 puntos, 2024-03-28, por
dxtrous); 38304483 «Alerting in realtime RAG: spot changes to LLM answers, using few tokens» (8 puntos, 5 comentarios, 2023-11-17); 42318221 «Build Live AI and RAG Pipelines in Minutes with YAML Templates» (8 puntos, 2024-12-04, porjanchorowski); 40987194 «Private RAG with Mistral, Ollama and Pathway» (5 puntos, porberkecanrizai).
No se pudo acceder a Reddit durante esta investigación (la API pública devolvió 403), por lo que no se reportan hilos de Reddit, ni se encontró página de Product Hunt, ni video de YouTube verificado del producto. Por ello no se infiere una discusión amplia ni un consenso que las fuentes no muestren. La prensa sobre la organización (WSJ, Forbes, MIT Technology Review, Live Science, Semafor, TechCrunch) se centra mayoritariamente en la arquitectura BDH y en la valoración, no en el marco ETL en sí.
Pathway frente a otras propuestas

| Proyecto | Coincidencia verificable | Diferencia verificable |
|---|---|---|
| Apache Flink / Apache Spark / Kafka Streams | Motores de procesamiento de flujos y de datos sobre los que Pathway se compara explícitamente en su README (que afirma superarlos en rendimiento) y en pathwaycom/pathway-benchmarks. | Flink/Spark/Kafka Streams son motores de streaming maduros y abiertos; Pathway ofrece API de Python de alto nivel, unificación lote/flujo con un solo código y una extensión LLM/RAG integrada. Las cifras de rendimiento son del propio proyecto, no una evaluación independiente. |
| Bases vectoriales + Redis + FastAPI (p. ej. Pinecone/Weaviate/Qdrant) | Un stack clásico para construir un RAG con índice vectorial, caché y API separada. | El README de llm-app enmarca a Pathway como la sustitución de esos módulos por un solo marco con índice vectorial (usearch) y texto completo (Tantivy) integrados, manteniendo el índice sincronizado en vivo. |
| LangChain / LlamaIndex | Frameworks para construir aplicaciones LLM/RAG. | No son competidores: Pathway se integra con ambos como vector store/retriever. La diferencia es de capa: Pathway es el motor de datos en vivo subyacente. |
| Airbyte | Herramienta de conectividad de datos. | Pathway incluye un conector Airbyte para más de 300 fuentes; no compite, lo usa como fuente. |
La comparación más útil no es por popularidad: Pathway destaca cuando se quiere un solo código Python para lote y flujo con RAG en vivo; los motores maduros (Flink/Spark) pueden ser preferibles cuando el requisito es un stack de streaming abierto y ampliamente adoptado, y los frameworks de IA (LangChain/LlamaIndex) resuelven la capa de orquestación de agentes, no el motor de datos.
Cómo contribuir
El proceso documentado en CONTRIBUTING.md es explícito y tiene un matiz poco habitual:
- El canal principal es Discord (canal de foro para preguntas, discusión de diseño o RFC) y el Issue Tracker de GitHub para bugs, crashes y problemas de rendimiento.
- Abrir un issue se declara «la contribución de mayor valor»: el equipo pide describir cómo se usa Pathway, qué falta, fricciones, bugs y patrones de uso recurrentes.
- Para código, se acepta un PR si (a) es pequeño y autocontenido (un fix, una corrección, una mejora de documentación) o (b) tiene aprobación explícita de un mantenedor (se solicita vía issue o Discord, con consejo de diseño previo).
- Para cambios grandes sin aprobación previa, el equipo «se reserva el derecho de cerrarlos sin una revisión detallada», argumentando que reconstruir el contexto de un cambio externo grande cuesta más que resolver el problema desde cero.
- Para librerías o conectores que se quieran integrar, el README sugiere publicarlos primero como repositorio separado bajo licencia MIT/Apache 2.0.
Casos de uso y a quién puede ayudar este repositorio
- Equipos de datos que operan pipelines sobre Kafka y quieren analítica en tiempo real con una sola base de código pueden usar el marco para que el mismo código sirva en local, en pruebas de CI/CD y en producción en flujo, evitando mantener una implementación de lote y otra de streaming.
- Equipos de IA que construyen RAG sobre documentos que cambian (contratos, informes financieros, comunicaciones) pueden partir de las plantillas de
pathwaycom/llm-app(p. ej. Private RAG con Ollama y Mistral o Multimodal RAG con GPT-4o) para que el índice vectorial se mantenga en vivo y las respuestas reflejen las fuentes actuales, sin gestionar por separado base vectorial, caché y API. - Personas que integran RAG con LangChain o LlamaIndex pueden usar Pathway como vector store/retriever subyacente, documentado en ambos ecosistemas, y como backend de recuperación para sus aplicaciones.
- Equipos que necesitan RAG sobre datos no estructurados a escala (miles de millones de páginas de documentos, según el README de
llm-app) pueden usar las plantillas optimizadas por precisión o por simplicidad y desplegarlas en Docker, Kubernetes o nubes (GCP, AWS, Azure, Render). - Investigadores o evaluadores de modelos de razonamiento pueden usar
pathwaycom/arc-task-genpara generar tareas de estilo ARC-AGI-1 que no estén en el conjunto público, útil para evaluar modelos como BDH-CQ.
Recursos
- Repositorio: https://github.com/pathwaycom/pathway
- Documentación y guía de usuario: https://pathway.com/developers/user-guide/introduction/welcome
- Plantillas de aplicaciones RAG/IA: https://github.com/pathwaycom/llm-app y https://pathway.com/developers/templates
- Integraciones de LangChain / LlamaIndex: https://docs.langchain.com/oss/python/integrations/vectorstores/pathway , https://developers.llamaindex.ai/python/examples/retrievers/pathway_retriever/
- Benchmarks: https://github.com/pathwaycom/pathway-benchmarks
- Comunidad / Discord: https://discord.gg/pathway
- Registro de paquetes (PyPI): https://pypi.org/project/pathway/
- Docker Hub: https://hub.docker.com/r/pathwaycom/pathway
- Blog y changelog oficial: https://pathway.com/blog/
- Hilos de Hacker News: https://news.ycombinator.com/item?id=40669434 , https://news.ycombinator.com/item?id=39852514 , https://news.ycombinator.com/item?id=38304483 , https://news.ycombinator.com/item?id=42318221
- Listas curadas:
vinta/awesome-python(entrada «pathway»)
Nota: este artículo combina el README, CONTRIBUTING.md, las notas de versión, la API de GitHub, PyPI, Docker Hub, la web oficial (pathway.com) y hilos de Hacker News consultados el 5 de septiembre de 2026. Las cifras cambian con el tiempo. Los datos de la organización y su giro hacia BDH proceden de su propia web y de la prensa citada; las afirmaciones de rendimiento del marco son del propio proyecto y no constituyen una evaluación independiente. No se pudo acceder a Reddit (403) y no se encontró página de Product Hunt ni video de YouTube verificado del producto.
Comentarios