12 de septiembre de 2026 · Por YasKad
pathwaycom/pathway

Pathway: un marco de datos en vivo para ETL, analítica en tiempo real y RAG

pathwaycom/pathway · 62.241★ · 1.681 forks

Todo lo que hay que saber sobre pathwaycom/pathway: un marco ETL de Python cuyo motor en Rust ejecuta el mismo código tanto para lotes como para flujos, con una extensión para tuberías de LLM y RAG. El informe se centra en el repositorio y en su organización, que en 2025-2026 ha reenfocado su imagen pública hacia una arquitectura de IA «post-transformer» (BDH).


Qué es Pathway

Pathway Live Data Framework (abreviado en el código como pw) es un marco ETL de Python para procesamiento de flujos, analítica en tiempo real, tuberías de LLM y RAG. No es un motor de base de datos ni un servicio: es una librería de Python que el usuario escribe como código normal y que un motor de Rust ejecuta.

La premisa central, verificable en el README, es la unificación de lote y flujo: el mismo código sirve para desarrollo local, pruebas de CI/CD, trabajos por lotes, relectura de un flujo y procesamiento de un flujo en vivo. El motor está basado en Differential Dataflow y realiza cómputo incremental, por lo que cuando cambia un dato el marco solo recalcula lo que se ve afectado.

El producto incluye tres bloques: un conector a las fuentes, transformaciones (con y sin estado: joins, ventanas, ordenamientos) y una extensión LLM con utilidades (wrappers, parsers, embedders, splitters) y un índice vectorial en memoria en vivo, con integraciones documentadas para LangChain y LlamaIndex.

Una impactante imagen cyberpunk de un marco de datos vivo: un dragón bebé neón formado por datos en streaming, microchips y grafos de dataflow diferencial, emergiendo de una sala de servidores oscura, su cuerpo brillante es una tubería unificada donde archivos por lotes y flujos de eventos en vivo se fusionan en un río luminoso, fluyendo a través de nodos de lógica Python, un núcleo de ejecución en Rust y un índice vectorial en vivo, paneles holográficos orbitando el dragón mostrando transformaciones ETL en tiempo real, joins, ventanas, reducers y recuperación RAG, fondo negro y carbón profundo, acentos neón cian, violeta y ámbar, luz volumétrica, ultra detallado, cinematográfico, 8K

Origen

El repositorio fue creado el 27 de noviembre de 2022 bajo la organización pathwaycom. La empresa es Pathway, con sede en Polonia. Los tres fundadores que lista la web oficial son:

  • Zuzanna Stamirowska, CEO. Doctora en sistemas complejos, graduada de la École Polytechnique, con modelos de predicción de redes publicados en la National Academy of Sciences.
  • Jan Chorowski, CTO. Exinvestigador de MILA y de Google Brain (bajo Samy Bengio), coautor de trabajo con Geoffrey Hinton y de los modelos de atención tempranos, coautor de la librería Theano; la web cita más de 12.000 citas e índice h de 24. Su nombre de usuario de GitHub, janchorowski, es el autor de los Show HN del proyecto.
  • Adrian Kosowski, CSO. Doctor en algoritmos, exInria, más de 100 artículos, índice h de 29; coautor del paper de BDH.

La cronología verificable de la organización, según su propio blog y prensa: una ronda de 10 millones de dólares (TechCrunch, 29 de noviembre de 2024); reconocimiento como «Emerging Visionary» en GenAI de Gartner (noviembre de 2024); una asociación declarada con AWS y NVIDIA para entregar sistemas de IA adaptativos (businesswire, 1 de diciembre de 2025); y una valoración de 500 millones de dólares anunciada a inicios de agosto de 2025.

El color narrativo más notable es un giro de identidad: el repositorio es un marco de datos/ETL/RAG, pero la portada de pathway.com hoy se presenta como «Intelligence with no ceiling», un laboratorio de IA de frontera que desarrolla BDH (Dragon Hatchling), una arquitectura recurrente «post-transformer» inspirada en el cerebro. El paper, «The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain» (arXiv 2509.26507, 2025), lleva firma de Kosowski, Uznański, Chorowski, Stamirowska y Bartoszkiewicz. El blog afirma que BDH fue el segundo paper de IA más popular de 2025. Este doble enfoque —datos en vivo por un lado, investigación de arquitecturas por otro— es la tensión real del proyecto: el marco ETL sigue siendo el producto instalable y con código, mientras que BDH es la apuesta de investigación que capta la prensa (WSJ, Forbes, MIT Technology Review, Live Science, Semafor).

Filosofía y principios

Del README y de la documentación se extraen estos principios, todos verificables en el texto oficial:

  • Un solo código para lote y flujo: la misma definición de tubería se ejecuta local, en pruebas, por lote, en relectura y en vivo.
  • Cómputo incremental: el motor no recalcula todo cuando llega un dato; actualiza solo lo derivado (base de Differential Dataflow).
  • Python para la lógica, Rust para la ejecución: el usuario escribe Python (y puede llamar a cualquier librería Python), pero el motor Rust habilita multihilo, multiproceso y cómputo distribuido, esquivando el límite de un solo hilo de Python.
  • La persistencia y la consistencia como servicio: el marco guarda el estado para reiniciar tras una actualización o un fallo, y gestiona el tiempo, actualizando resultados cuando llegan datos tardíos o desordenados.
  • RAG «en vivo»: el índice vectorial se construye y mantiene a medida que cambian los documentos, de modo que las respuestas de un RAG reflejan el estado actual de la fuente.

Una visualización cyberpunk oscura de una sola tubería unificada a través de cinco entornos: un portátil, un escudo de CI/CD, un almacén por lotes, una cinta de relectura y una baliza de flujo en vivo, todos conectados por el mismo grafo de código brillante, paquetes de datos neón idénticos viajando a través de cada entorno sin cambiar de forma, enfatizando la unificación de lote y flujo, glifos de script abstractos tipo Python y núcleos de motor Rust, ramas holográficas, fondo carbón profundo, neón cian y magenta, ultra detallado, 8K

Cómo funciona

El patrón básico documentado (del ejemplo del README) es:

  1. pw.io.<fuente>.read(...) conecta a la fuente y devuelve una tabla (con un pw.Schema opcional que tipa las columnas).
  2. Se encadenan transformaciones sobre la tabla: .filter(...), .reduce(...) con pw.reducers.*, joins, ventanas, o cualquier función de Python.
  3. pw.io.<destino>.write(tabla, ...) carga el resultado a un sistema externo.
  4. pw.run() arranca el cómputo.

El proyecto se ejecuta como un guion de Python normal: python main.py. El marco arranca un panel de monitoreo (mensajes por conector, latencia y logs). Alternativas de arranque documentadas: pathway spawn python main.py y, para multihilo, pathway spawn --threads 3 python main.py.

Una imagen de dataflow diferencial incremental: un pequeño delta de datos entra en un grafo neuronal denso, causando que solo una cadena precisa de nodos afectados pulse y recalcule mientras el resto permanece atenuado, efectos de ondulación, bordes de dependencia brillantes, capas de estado antes-y-después, instantáneas desplazadas en el tiempo, laboratorio cyberpunk oscuro, acentos azul eléctrico y ámbar, ultra detallado, 8K

El motor mantiene la tubería en memoria. La versión libre da una garantía de consistencia «al menos una vez»; la versión de empresa da «exactamente una vez». En la publicación v0.32.1 (1 de agosto de 2026) se añadieron, entre otros, los conectores de escritura pw.io.chroma.write y pw.io.qdrant.write, que mantienen una colección de base vectorial sincronizada con la tabla.

Una composición dividida de lógica Python y ejecución Rust: una superficie de código Python brillante con bloques de función flexibles alimentando un núcleo de motor Rust endurecido con engranajes multihilo, nodos de trabajo distribuidos y carriles de memoria paralelos, una jaula de luz rota simboliza escapar del límite de un solo hilo, multihilo de alto rendimiento, modo oscuro, neón cian, naranja y violeta, ultra detallado, 8K

La extensión LLM (llamada LLM xpack en la documentación) agrega wrappers de servicios LLM, parsers, embedders, splitters, un índice vectorial en memoria en vivo y las integraciones con LangChain y LlamaIndex. Los modelos listados de la web como «Colaboraciones destacadas» incluyen Databento, LangChain, LlamaIndex, MinIO, PaddleOCR y Redpanda.

Una escena de índice vectorial RAG en vivo: documentos, PDFs, registros de chat y registros de bases de datos fluyen continuamente hacia un índice vectorial en memoria pulsante en forma de red cristalina, un haz de consulta de usuario recupera los embeddings más recientes y actualiza respuestas en tiempo real, rutas de recuperación holográficas, clústeres de similitud y nodos de integración abstractos para LangChain y LlamaIndex, fondo cyberpunk oscuro, acentos neón teal y rosa, ultra detallado, 8K

El ecosistema

Repositorios de la organización pathwaycom

  • pathwaycom/llm-app: plantillas de aplicaciones listas para desplegar (RAG, búsqueda empresarial, pipelines de IA) sobre el marco; 58.937 estrellas y 1.479 bifurcaciones. Es el hermano más grande y es donde vive el catálogo de plantillas: Question-Answering RAG App, Live Document Indexing, Multimodal RAG con GPT-4o, Unstructured-to-SQL, Adaptive RAG App, Private RAG con Mistral y Ollama, Slides AI Search y Video RAG con TwelveLabs. El README de ese repositorio indica que el índice vectorial por defecto usa usearch y los índices híbridos de texto completo usan Tantivy, y que sustituyen módulos separados de base vectorial (Pinecone/Weaviate/Qdrant), caché (Redis) y framework de API (FastAPI).
  • pathwaycom/arc-task-gen: genera tareas nuevas de estilo ARC-AGI-1 para evaluar modelos como BDH-CQ; 10.625 estrellas y 68 bifurcaciones.
  • pathwaycom/bdh: implementación oficial de la arquitectura Dragon Hatchling (el paper de 2025); 3.545 estrellas y 252 bifurcaciones.
  • pathwaycom/pathway-benchmarks: benchmarks contra Spark, Flink y Kafka Streams; 302 estrellas y 12 bifurcaciones.
  • pathwaycom/cookiecutter-pathway: plantilla para arrancar proyectos de Pathway listos para producción; 277 estrellas y 17 bifurcaciones.
  • pathwaycom/serviette: herramienta de RAG descrita como «Universal RAG tool»; 4 estrellas.

Un panel de control neón modular representando una extensión LLM: paneles brillantes para wrappers, parsers, embedders, splitters y conectores de almacén vectorial en vivo, tuberías conectando núcleos de modelo de lenguaje con parsers de documentos, matrices de embedding, splitters de chunks y bases de datos vectoriales, nodos de integración abstractos para LangChain y LlamaIndex, modo oscuro, estética tecnológica cyberpunk, acentos neón cian, magenta y ámbar, ultra detallado, 8K

Repositorios relacionados fuera de la organización

  • pathway-labs/pathway-examples: ejemplos de código del marco; 43 estrellas y 6 bifurcaciones (pertenecen a una organización distinta, pathway-labs, no a pathwaycom).
  • xyphoes0727/FraudDetection (5 estrellas): un pipeline de detección de fraude en tiempo real construido con Pathway, ejemplo de adopción comunitaria.

Bifurcaciones

Las bifurcaciones con más estrellas del repositorio principal tienen pocas estrellas (máximo 6, p. ej. sheikhsajid69/pathway), lo que sugiere que el ecosistema crece más por los repos hermanos oficiales y por plantillas que por forks independientes del núcleo. No se encontró, en la búsqueda realizada, una traducción comunitaria al español u otro idioma del marco.

Estado oficial / semioficial

Pathway es un producto con respaldo de proveedores y reconocimientos de terceros, no un estándar abierto nombrado:

  • Gartner lo reconoció como Emerging Visionary en GenAI (noviembre de 2024).
  • Existe una asociación declarada con AWS y NVIDIA para sistemas de IA adaptativos y de aprendizaje continuo (businesswire, 1 de diciembre de 2025).
  • El README lista colaboraciones e integraciones con Databento, LangChain, LlamaIndex, MinIO, PaddleOCR y Redpanda. LangChain y LlamaIndex documentan a Pathway como integraciones (vector store / retriever).
  • El proyecto aparece en listas curadas como vinta/awesome-python (entrada «pathway», línea 497 del README de esa lista).

Lo que esto significa en la práctica: Pathway es una opción instalable y documentada dentro de los ecosistemas de LangChain y LlamaIndex, y una alternativa comercial a los motores de streaming maduros (Flink, Spark, Kafka Streams) con un punto diferencial en RAG en vivo. No hay, en las fuentes consultadas, una designación formal de «estándar de facto»; su posición es la de un proveedor vertical (datos en vivo + RAG + IA) con tracción de prensa y de partners.

Una arquitectura post-transformer Dragon Hatchling: un núcleo neuronal recurrente inspirado en el cerebro con un pequeño dragón bebé neón brillante en su centro, rodeado de capas de atención tipo transformer y redes de sinapsis biológicas, la imagen muestra un puente entre la geometría transformer y la recurrencia tipo cerebro, pulsos de energía recorriendo celdas de memoria, laboratorio oscuro, acentos neón violeta, cian y dorado, ultra detallado, 8K

Guía rápida de uso

Instalación y primer arranque

Prerrequisitos: Python 3.10 o superior y macOS o Linux (el README indica que en otros sistemas conviene usar una máquina virtual).

pip install -U pathway

El ejemplo mínimo documentado (sumar valores positivos en tiempo real) es:

import pathway as pw

class InputSchema(pw.Schema):
  value: int

input_table = pw.io.csv.read("./input/", schema=InputSchema)
filtered_table = input_table.filter(input_table.value >= 0)
result_table = filtered_table.reduce(
  sum_value = pw.reducers.sum(filtered_table.value)
)

pw.io.jsonlines.write(result_table, "output.jsonl")
pw.run()

Al ejecutar python main.py se abre un panel de monitoreo con mensajes por conector, latencia y logs. Para arrancar con un número concreto de hilos: pathway spawn --threads 3 python main.py. Hay un notebook en Google Colab enlazado desde el README y más ejemplos en examples/.

Flujos de trabajo habituales

  • ETL en tiempo real desde Kafka: se define una tubería que lee un tema Kafka, transforma y escribe a un destino; el README enlaza la plantilla kafka-etl y la guía «Switch from batch to streaming». El resultado es una pipeline que, al llegar un nuevo mensaje, actualiza solo los cálculos afectados.
  • RAG privado y autocontenido: desde pathwaycom/llm-app, la plantilla Private RAG con Mistral y Ollama corre localmente; al sincronizar con una carpeta/Google Drive/SharePoint, el índice se actualiza en vivo y las respuestas reflejan los documentos más recientes.
  • Unstructured-to-SQL: la plantilla unstructured_to_sql_on_the_fly lee PDFs financieros, los estructura en SQL, carga a PostgreSQL y responde consultas en lenguaje natural traduciéndolas a SQL.
  • Ejecución en Docker: para un guion de un solo archivo, docker run -it --rm --name my-pathway-app -v "$PWD":/app pathwaycom/pathway:latest python my-pathway-app.py.

Un panel de despliegue y monitoreo en tiempo real: un dashboard oscuro con mensajes de conector brillantes, gráficas de latencia, flujos de log y paneles de asignación de hilos, un contenedor Docker y una terminal CLI brillando junto a una rejilla de ejecución multiproceso, una tubería corriendo con escudos de consistencia mostrados como emblemas abstractos, fondo cyberpunk oscuro, acentos neón verde, cian y violeta, ultra detallado, 8K

Configuración esencial

  • pw.Schema: tipa las columnas de una tabla; opcional pero recomendado para validación.
  • Conectores pw.io.*: elige la fuente/destino (csv, jsonlines, kafka, postgresql, gdrive, chroma, qdrant, entre otros); son la primera cosa que se toca.
  • pathway spawn --threads N: controla el paralelismo multihilo local.
  • Backend de persistencia: el backend de estado (S3 o archivo local) se elige por parámetro de configuración del código, según lo aclarado por el equipo en el hilo de Hacker News.
  • Plantillas de llm-app: para RAG, se parte de una plantilla y se cambia la fuente o el tipo de índice (vectorial → híbrido) con «un cambio de una línea», según su README.

Trampas frecuentes y soluciones

  • Sistemas no soportados: el README advierte que Pathway está disponible solo para macOS y Linux; en otros entornos se recomienda una máquina virtual.
  • Consistencia: la versión libre da «al menos una vez»; si se requiere «exactamente una vez» hace falta la versión de empresa. Es un límite de licencia, no un bug.
  • Requisito de RAM en producción: el equipo aclaró en el hilo de Hacker News que el factor dominante del consumo de RAM es el tamaño de los datos que se alimentan, especialmente con un índice en memoria. La pregunta de un usuario sobre el plan «Community 8 GB / 4 núcleos» quedó sin una cifra concreta de requisitos mínimos publicada en las fuentes recuperadas.
  • Bifurcaciones grandes: el CONTRIBUTING indica que un PR sustancial sin aprobación previa de un mantenedor puede cerrarse sin revisión detallada; para contribuciones grandes conviene abrir primero un issue.

Integraciones y migración

  • LangChain / LlamaIndex: Pathway se integra como vector store / retriever (documentado en ambos ecosistemas); las plantillas de llm-app actúan como backend de recuperación para aplicaciones de LangChain o LlamaIndex.
  • Bases vectoriales: pw.io.chroma.write y pw.io.qdrant.write (v0.32.1) escriben la tabla a Chroma/Qdrant manteniendo la colección sincronizada.
  • Streaming: conectores para Kafka (y, por extensión, ecosistemas de streaming como Redpanda) y el conector Airbyte para más de 300 fuentes.
  • Despliegue: Docker (imagen pathwaycom/pathway:latest), Kubernetes y nubes; hay una guía de despliegue en Render en la documentación.
  • Migración desde bases vectoriales/caché/API separadas: el README de llm-app enmarca a Pathway como la sustitución de un stack de módulos separados (vector DB + Redis + FastAPI) por un solo marco con índice vectorial (usearch) y texto completo (Tantivy) integrados.

Métricas actuales

Medición: 5 de septiembre de 2026, API de GitHub.

MétricaValor
Estrellas62.344
Bifurcaciones1.687
Suscriptores120
Incidencias abiertas indicadas por la API35
Commits≈2.233
Lenguaje principalPython
LicenciaBSL 1.1 («Other» en la API)
Rama por defectomain
Creación27 de noviembre de 2022
Última publicaciónv0.32.1, 1 de agosto de 2026

Los principales contribuidores devueltos por la API, por número de contribuciones, fueron Pathway-Dev (837), zxqfd555 (436), pw-ppodhajski (136), szymondudycz (123), olruas (122), KamilPiechowiak (113) y berkecanrizai (92). El conteo de ≈2.233 commits proviene de la página final del enlace de paginación de la API de commits. watchers_count de la respuesta general replica el número de estrellas, y open_issues_count (35) puede incluir solicitudes de cambios abiertas. En PyPI, la versión actual es 0.32.1 con 80 versiones publicadas y requires_python >=3.10; pypistats reportó 172 descargas en el último día, 927 en la semana y 7.273 en el mes. En Docker Hub, la imagen pathwaycom/pathway registró 14.000 descargas acumuladas y 2 estrellas (última actualización 31 de julio de 2026).

Recepción de la comunidad

La evidencia recuperada muestra interés concreto, especialmente en RAG en vivo, y preguntas prácticas del equipo:

  • En el hilo de Hacker News 40669434 —«Show HN: Pathway – Build Mission Critical ETL and RAG in Python (NATO, F1 Used)», publicado el 13 de junio de 2024 por janchorowski (CTO)— se alcanzaron 73 puntos. Entre los comentarios verificados: pipboyguy escribió «I’ve built DE and AI solutions based on Pathway for multiple clients. It’s robust and fast» (evidencia de uso profesional, no una evaluación independiente); snowpid comentó irónicamente sobre el uso corporativo («Good old “Enterprise” NATO!»); Arimbr preguntó si, al mantenerse todo en memoria, Pathway persiste estado en algún sitio; threecheese preguntó por el plan «Community 8 GB RAM / 4 núcleos» y si hay algo que se hospede siempre; sriyansh7 preguntó qué casos de uso ve para RAG sobre datos en flujo.
  • Respondieron miembros del equipo: dxtrous (Adrian, de Pathway) aclaró que todo es RAM-based y que la persistencia/caché se apoya en backends de archivo (S3 o local) configurables, que el consumo de RAM depende sobre todo del tamaño de los datos (sobre todo con índice en memoria), y que el dominio sigue siendo mayormente datos no estructurados (mensajería, índice en vivo de comunicaciones, redes sociales, noticias). janchorowski agradeció y pidió detalles de casos de uso.
  • Otros Show HN del proyecto, con tracción menor: 39852514 «Adaptive RAG – How we cut LLM costs without sacrificing accuracy» (8 puntos, 2024-03-28, por dxtrous); 38304483 «Alerting in realtime RAG: spot changes to LLM answers, using few tokens» (8 puntos, 5 comentarios, 2023-11-17); 42318221 «Build Live AI and RAG Pipelines in Minutes with YAML Templates» (8 puntos, 2024-12-04, por janchorowski); 40987194 «Private RAG with Mistral, Ollama and Pathway» (5 puntos, por berkecanrizai).

No se pudo acceder a Reddit durante esta investigación (la API pública devolvió 403), por lo que no se reportan hilos de Reddit, ni se encontró página de Product Hunt, ni video de YouTube verificado del producto. Por ello no se infiere una discusión amplia ni un consenso que las fuentes no muestren. La prensa sobre la organización (WSJ, Forbes, MIT Technology Review, Live Science, Semafor, TechCrunch) se centra mayoritariamente en la arquitectura BDH y en la valoración, no en el marco ETL en sí.

Pathway frente a otras propuestas

Una galería flotante de ecosistema neón: tarjetas de app para RAG de preguntas-respuestas, indexado de documentos en vivo, RAG multimodal, búsqueda empresarial, RAG privado local, búsqueda de diapositivas, RAG de video y unstructured-to-SQL, cada tarjeta contiene iconos abstractos de documentos, videos, bases de datos e interfaces de chat, conectados a un hub central de marco de datos en vivo, modo oscuro, estética cyberpunk, acentos azul eléctrico y naranja, ultra detallado, 8K

ProyectoCoincidencia verificableDiferencia verificable
Apache Flink / Apache Spark / Kafka StreamsMotores de procesamiento de flujos y de datos sobre los que Pathway se compara explícitamente en su README (que afirma superarlos en rendimiento) y en pathwaycom/pathway-benchmarks.Flink/Spark/Kafka Streams son motores de streaming maduros y abiertos; Pathway ofrece API de Python de alto nivel, unificación lote/flujo con un solo código y una extensión LLM/RAG integrada. Las cifras de rendimiento son del propio proyecto, no una evaluación independiente.
Bases vectoriales + Redis + FastAPI (p. ej. Pinecone/Weaviate/Qdrant)Un stack clásico para construir un RAG con índice vectorial, caché y API separada.El README de llm-app enmarca a Pathway como la sustitución de esos módulos por un solo marco con índice vectorial (usearch) y texto completo (Tantivy) integrados, manteniendo el índice sincronizado en vivo.
LangChain / LlamaIndexFrameworks para construir aplicaciones LLM/RAG.No son competidores: Pathway se integra con ambos como vector store/retriever. La diferencia es de capa: Pathway es el motor de datos en vivo subyacente.
AirbyteHerramienta de conectividad de datos.Pathway incluye un conector Airbyte para más de 300 fuentes; no compite, lo usa como fuente.

La comparación más útil no es por popularidad: Pathway destaca cuando se quiere un solo código Python para lote y flujo con RAG en vivo; los motores maduros (Flink/Spark) pueden ser preferibles cuando el requisito es un stack de streaming abierto y ampliamente adoptado, y los frameworks de IA (LangChain/LlamaIndex) resuelven la capa de orquestación de agentes, no el motor de datos.

Cómo contribuir

El proceso documentado en CONTRIBUTING.md es explícito y tiene un matiz poco habitual:

  • El canal principal es Discord (canal de foro para preguntas, discusión de diseño o RFC) y el Issue Tracker de GitHub para bugs, crashes y problemas de rendimiento.
  • Abrir un issue se declara «la contribución de mayor valor»: el equipo pide describir cómo se usa Pathway, qué falta, fricciones, bugs y patrones de uso recurrentes.
  • Para código, se acepta un PR si (a) es pequeño y autocontenido (un fix, una corrección, una mejora de documentación) o (b) tiene aprobación explícita de un mantenedor (se solicita vía issue o Discord, con consejo de diseño previo).
  • Para cambios grandes sin aprobación previa, el equipo «se reserva el derecho de cerrarlos sin una revisión detallada», argumentando que reconstruir el contexto de un cambio externo grande cuesta más que resolver el problema desde cero.
  • Para librerías o conectores que se quieran integrar, el README sugiere publicarlos primero como repositorio separado bajo licencia MIT/Apache 2.0.

Casos de uso y a quién puede ayudar este repositorio

  • Equipos de datos que operan pipelines sobre Kafka y quieren analítica en tiempo real con una sola base de código pueden usar el marco para que el mismo código sirva en local, en pruebas de CI/CD y en producción en flujo, evitando mantener una implementación de lote y otra de streaming.
  • Equipos de IA que construyen RAG sobre documentos que cambian (contratos, informes financieros, comunicaciones) pueden partir de las plantillas de pathwaycom/llm-app (p. ej. Private RAG con Ollama y Mistral o Multimodal RAG con GPT-4o) para que el índice vectorial se mantenga en vivo y las respuestas reflejen las fuentes actuales, sin gestionar por separado base vectorial, caché y API.
  • Personas que integran RAG con LangChain o LlamaIndex pueden usar Pathway como vector store/retriever subyacente, documentado en ambos ecosistemas, y como backend de recuperación para sus aplicaciones.
  • Equipos que necesitan RAG sobre datos no estructurados a escala (miles de millones de páginas de documentos, según el README de llm-app) pueden usar las plantillas optimizadas por precisión o por simplicidad y desplegarlas en Docker, Kubernetes o nubes (GCP, AWS, Azure, Render).
  • Investigadores o evaluadores de modelos de razonamiento pueden usar pathwaycom/arc-task-gen para generar tareas de estilo ARC-AGI-1 que no estén en el conjunto público, útil para evaluar modelos como BDH-CQ.

Recursos


Nota: este artículo combina el README, CONTRIBUTING.md, las notas de versión, la API de GitHub, PyPI, Docker Hub, la web oficial (pathway.com) y hilos de Hacker News consultados el 5 de septiembre de 2026. Las cifras cambian con el tiempo. Los datos de la organización y su giro hacia BDH proceden de su propia web y de la prensa citada; las afirmaciones de rendimiento del marco son del propio proyecto y no constituyen una evaluación independiente. No se pudo acceder a Reddit (403) y no se encontró página de Product Hunt ni video de YouTube verificado del producto.

Comentarios