MindBench

Benchmark Infrastructure

Reproducible experiments with full provenance. 20 metrics. Hardware profiles. Config snapshots. No cherry-picking.

MicroMind Experiment 001

Planned

Compare 0.8B variants (A-I) against raw 2B and 4B models

Models

Qwen2.5-0.5BQwen2.5-1.5BPhi-3-miniLlama-3.2-1BLlama-3.2-3B

Metrics

Task SuccessAccuracyLatencyCostMemory
Apple M2 (8GB RAM) Darwin 0.2
View Experiment Details

First Evolution Demo

Planned

Identify weakness → generate candidates → sandbox → benchmark → promote

Models

Qwen2.5-0.5B + evolution

Metrics

Pre/Post evolution deltaRegression checkCost delta
Apple M2 (8GB RAM) Darwin 0.2
View Experiment Details

MindBench Metrics (20 Dimensions)

Every benchmark run captures all 20 metrics. No cherry-picking. Full provenance recorded.

Task Success↑ Better
%
Accuracy↑ Better
%
Factuality↑ Better
%
Hallucination↓ Better
%
Latency (p50)↓ Better
ms
Latency (p95)↓ Better
ms
Tokens/sec↑ Better
tok/s
RAM Peak↓ Better
GB
CPU Avg↓ Better
%
GPU Util↑ Better
%
Model Load↓ Better
s
Compute↓ Better
FLOPs
Energy↓ Better
Wh
Cost↓ Better
$
Tool Calls↓ Better
#
Escalation↓ Better
%
Mem Retrieval↑ Better
#
Skill Reuse↑ Better
#
Adaptation↑ Better
%
Forgetting↓ Better
%
Regression↓ Better
%
Reliability↑ Better
%

Reproducibility by Design

Fixed seeds, config snapshots, dependency hashes, hardware fingerprints. Anyone can re-run and verify.

Fixed SeedsConfig SnapshotsDependency HashesHardware FingerprintsFull Provenance

Run Your Own Benchmarks

Clone the repo, run seai doctor, and start benchmarking your own Minds.

One Command
seai init → seai run
Local First
Runs on your hardware
Evolves
Improves through experience