Software Engineer Β· Distributed Systems & Database Internals
San Francisco Bay Area, CA
- π Software Engineer specializing in distributed systems, database internals, and cloud-native storage abstractions.
- π οΈ Deeply interested in open lakehouse architectures (Apache Iceberg), decoupled storage-compute environments, and consensus protocols (Raft).
- π» Experienced in building high-concurrency, low-latency system components in C++20 and Java.
- π Currently pursuing my M.S. in Computer Software Engineering at San JosΓ© State University (Expected May 2027).
Tech Stack: C++20, gRPC, PostgreSQL, AWS EC2, CMake
- Architected a high-concurrency metadata control plane in C++20 for open table formats (Apache Iceberg) storing columnar data (Parquet).
- Implemented MVCC-based versioning in the storage layer to expose consistent snapshot reads over gRPC during concurrent DDL operations.
- Optimized for decoupled storage-compute environments, achieving sub-10ms metadata retrieval for 1M+ active data partitions.
Tech Stack: Java 17, Raft Consensus, GKE, Docker, GCS
- Built a production-grade distributed object storage system, orchestrating cluster metadata and chunk placement decisions via the Raft consensus algorithm.
- Implemented a consistent hashing ring for request routing with quorum-based replication (RF=3) for cross-node data durability.
- Containerized infrastructure deployed via GKE StatefulSets, persisting chunk data to dedicated GCP buckets.
Tech Stack: Java 17, Spring Boot, Azure Event Hubs, SQL Partitioning
- Developed a distributed ledger supporting concurrent multi-asset billing transactions with strict ACID compliance.
- Leveraged Azure Event Hubs for high-throughput event ingestion, maintaining an immutable audit trail with 99.99% durability.
- Achieved sub-50ms validation latency for atomic transactions via an optimized SQL partitioning strategy.
Tech Stack: Python, FastAPI, Docker, LlamaIndex, Ollama, AST
- Containerized agent unifying siloed developer data β estimated 75% faster time-to-information.
- CodeβGraph pipeline via Python AST +
networkx, parsing 15k+ LOC (requests library) into a knowledge graph of 290+ symbols. - Agentic RAG with Llama 3 (local) + custom tools for graph querying. Real-time interface via Discord Bot + REST backend β answers in <5s.
Tech Stack: Java, Spring Boot, Kafka, MongoDB, REST
- High-volume ingestion from multiple sources into centralized MongoDB using Kafka + Spring Boot.
- Full-text search & flexible field filters via REST for precise, fast retrieval.
- Core Domains: Distributed Consensus (Raft), Storage-Compute Decoupling, Catalog Management, Concurrency Control, Multi-threading, Agentic RAG.
- Data & Formats: Apache Iceberg, Apache Parquet, Apache Flink, MVCC.
- πΌ LinkedIn: linkedin.com/in/vineet-malewar
- βοΈ Email: vineet.connects1@gmail.com
- π Portfolio: vineetmalewar.vercel.app
- πΈ Instagram: instagram.com/vineet_20.05
"Building reliable distributed systems at scale."


