// DOCUMENTATION

Wikipedia crawl

Real-world crawl benchmark: 100 Wikipedia articles at concurrency 8.

Benchmarks

Real-world crawl benchmark against live en.wikipedia.org. Last run: 2026-06-29 · 100 pages · concurrency 8 · Apple M1.

What this measures

  • Class: crawler-runtime — network → HTML parse → DOM extract
  • Mode: extract (title + wiki links via querySelector)
  • Koko:koko serve (multi-process)
  • Chromium: 8 tabs, 1 browser (multi-tab-single-process)

Architecture note

Peak process count and peak RSS are not apples-to-apples across architectures. Use RSS/page, sessions/GB, and CPU-sec/page for cost comparisons.

Scalability comparison

MetricKokoChromiumRatio (V/C)
Wall time8911 ms11965 ms0.74×
Throughput11.22 p/s8.36 p/s1.34×
Mean latency648.0 ms829.4 ms0.78×
TTFX mean648.0 ms751.8 ms0.86×
Peak RSS852.8 MiB2988.0 MiB0.29×
RSS / page8.5 MiB29.9 MiB0.29×
Sessions / GB924.50×
CPU-sec / page0.08830.15100.58×
Success rate100/100100/100

Cost & density takeaways

  • Memory: Koko peak RSS ~3× lower — better footprint per crawl worker
  • Agent density: ~9 concurrent sessions per GB RAM vs Chromium ~2
  • CPU cost: 0.088 vs 0.151 CPU-sec/page
  • TTFX: Koko reaches first extractable element faster

Limitations

Wikipedia articles are mostly static HTML. This workload does not stress WebGL, SPA routing, React hydration, service workers, or bot detection.