Awesome Cloud Native
Section: Data Processing & Analytics · Reproducible Data Science at Scale!
Entry
Appears in 5 awesome lists
Open source distributed processing framework build on Kubernetes focused mainly on dynamic building of production machine learning pipelines - (Video).
Section: Data Processing & Analytics · Reproducible Data Science at Scale!
Section: Go · "provides parallelized processing of multi-stage, language-agnostic pipelines with data versioning and data lineage tracking."
Section: Data Management · Pachyderm is a version control system for data.
Section: Data Pipeline · Open source distributed processing framework build on Kubernetes focused mainly on dynamic building of production machine learning pipelines - (Video).
Section: Data Science and Analytics · Data-Centric Pipelines and Data Versioning
Dolt is Git for Data! Dolt is a SQL database that you can fork, clone, branch, merge, push and pull just like a git repository.
Version control for large files. kedro - Build data pipelines. feast - Feature store. Video. pgvector - Vector similarity search for Postgres. pinecone - Database for vector search applications. truss - Serve ML models. milvus - Vector database for similarity search. mlem - Version and deploy your…
Data pipelines for cloud config and security data. Build cloud asset inventory, CSPM, FinOps, and vulnerability management solutions. Extract from AWS, Azure, GCP, and 70+ cloud and SaaS sources.
Open-source storage framework enabling Lakehouse architecture with ACID transactions, scalable metadata handling, and unified batch/streaming processing. Apache 2.0 licensed.
Brings machine learning capabilities to SQL, enabling model training and prediction using SQL syntax.
Versioning, reproducibility and deployment of data and models.
Ultrafast and elastic data processing.
Kafka Docker for development. Kafka, Zookeeper, Schema Registry, Kafka-Connect, Landoop Tools, 20+ connectors.