Data → Data Platforms
MPP
A distributed analytical processing architecture that executes one query across many independent compute nodes.
Motivation
MPP lets analytical systems scan, join, and aggregate very large datasets by dividing work across many nodes.
How it works
A coordinator creates a distributed query plan. Worker nodes process partitions in parallel, exchange intermediate data when necessary, and return partial results for final aggregation.
Shared-nothing model
Many MPP systems use a shared-nothing design: each node owns its CPU, memory, and storage partitions. This reduces contention but makes data distribution and network shuffles important design concerns.
Where it fits
MPP is common in analytical databases, cloud data warehouses, and large-scale BI platforms. It favors broad scans and aggregation rather than high-frequency transactional updates.
Trade-offs
- Good partitioning improves parallelism and reduces data movement.
- Skew can overload a subset of nodes.
- Elastic systems trade predictable locality for flexible scaling.
- Parallel execution improves throughput, but coordination and shuffle costs remain.
Common mistakes
- Assuming more nodes always make every query faster.
- Ignoring data skew and join distribution.
- Using an analytical MPP system as an OLTP database.