Arrow

New
trial
First Added:July 23, 2026

Apache Arrow is a language-independent columnar memory format plus libraries for fast in-memory analytics and zero-copy interchange. We trial it as the in-memory companion to Parquet on disk.

Blurb

The universal columnar format and multi-language toolbox for fast data interchange and in-memory analytics

Summary

What it is: Columnar layout for flat and nested data, optimized for CPUs/GPUs. Supports zero-copy reads without serialization tax. Libraries exist across languages; many engines use Arrow for IPC and compute kernels.

When to use:

SituationNotes
In-memory analyticsShare batches across processes without copy
Polyglot pipelinesPython, Rust, Java, Go exchange the same buffers
Engine plumbingDuckDB, Spark, and others speak Arrow

When to skip:

  • Durable lake storage (Parquet files)
  • Simple scripts over small CSV dumps
  • No multi-language or zero-copy requirement

Trade-offs: Excellent interchange and speed; another format layer to learn. On-disk default remains Parquet for most lakes.

Details

Format vs Libraries

PieceRole
Arrow formatSpec for columnar memory layout
Arrow librariesLanguage bindings and compute building blocks
EcosystemUsed inside analytic engines and dataframe stacks

Related Garden Items

  • Parquet - common on-disk columnar format
  • DuckDB - reads/writes Arrow-friendly workflows

References