/ concept-collection / benchcompress
Sign in
concept-collection / benchcompress
format
Jeremy Magland <jmagland@flatironinstitute.org> committed commit 769ad9ac568b parent 9900d62 Browse files
8 changed files+25−19
README.mdmodified+2−2View file
@@ -1,10 +1,10 @@
11 # zia
22
3-A benchmarking framework for evaluating compression algorithms on integer array datasets, with a focus on scientific data.
3+A benchmarking framework for evaluating compression algorithms on numeric array datasets, with a focus on scientific data.
44
55 ## Overview
66
7-Zia provides systematic benchmarking of compression methods for integer arrays, measuring:
7+Zia provides systematic benchmarking of compression methods for numeric arrays, measuring:
88 - Compression ratio
99 - Encoding throughput (MB/s)
1010 - Decoding throughput (MB/s)
web-ui/src/pages/About.tsxmodified+1−1View file
@@ -9,7 +9,7 @@ const About: React.FC = () => {
99 style={{ fontSize: "1.1rem", lineHeight: "1.6", marginBottom: "2rem" }}
1010 >
1111 Zia is a benchmarking framework for evaluating compression algorithms on
12- integer array datasets, with a focus on scientific data. It measures
12+ numeric array datasets, with a focus on scientific data. It measures
1313 compression ratios and performance metrics across various algorithms and
1414 datasets.
1515 </p>
web-ui/src/pages/Home.tsxmodified+1−1View file
@@ -24,7 +24,7 @@ function Home({ benchmarkData }: HomeProps) {
2424 marginTop: "0.5rem",
2525 }}
2626 >
27- Comparing integer array compression algorithms
27+ Comparing numeric array compression algorithms
2828 </p>
2929 </header>
3030 <main>
zia_benchmark/setup.pymodified+1−1View file
@@ -22,7 +22,7 @@ setup(
2222 ],
2323 },
2424 author="Jeremy Magland",
25- description="Benchmarking compression methods for integer arrays",
25+ description="Benchmarking compression methods for numeric arrays",
2626 long_description=open("README.md").read(),
2727 long_description_content_type="text/markdown",
2828 keywords="compression, signal processing",
zia_benchmark/src/zia_benchmark/cli.pymodified+1−1View file
@@ -59,7 +59,7 @@ def validate_datasets(ctx, param, value):
5959
6060 @click.group()
6161 def cli():
62- """Benchmark compression algorithms for integer arrays"""
62+ """Benchmark compression algorithms for numeric arrays"""
6363 pass
6464
6565
zia_benchmark/src/zia_benchmark/datasets/bernoulli/__init__.pymodified+7−5View file
@@ -10,13 +10,15 @@ def create_bernoulli(*, n_samples: int, p: float, seed: int) -> np.ndarray:
1010 return x
1111
1212
13+tags = ["binary", "integer", "discrete", "synthetic"]
14+
1315 datasets = [
1416 {
1517 "name": "bernoulli-0.1",
1618 "version": "3",
1719 "create": lambda: create_bernoulli(n_samples=1_000_000, p=0.1, seed=0),
1820 "description": "Binary sequence with 10% probability of ones.",
19- "tags": ["binary"],
21+ "tags": tags,
2022 "source_file": SOURCE_FILE,
2123 },
2224 {
@@ -24,7 +26,7 @@ datasets = [
2426 "version": "3",
2527 "create": lambda: create_bernoulli(n_samples=1_000_000, p=0.2, seed=0),
2628 "description": "Binary sequence with 20% probability of ones.",
27- "tags": ["binary"],
29+ "tags": tags,
2830 "source_file": SOURCE_FILE,
2931 },
3032 {
@@ -32,7 +34,7 @@ datasets = [
3234 "version": "3",
3335 "create": lambda: create_bernoulli(n_samples=1_000_000, p=0.3, seed=0),
3436 "description": "Binary sequence with 30% probability of ones.",
35- "tags": ["binary"],
37+ "tags": tags,
3638 "source_file": SOURCE_FILE,
3739 },
3840 {
@@ -40,7 +42,7 @@ datasets = [
4042 "version": "3",
4143 "create": lambda: create_bernoulli(n_samples=1_000_000, p=0.4, seed=0),
4244 "description": "Binary sequence with 40% probability of ones.",
43- "tags": ["binary"],
45+ "tags": tags,
4446 "source_file": SOURCE_FILE,
4547 },
4648 {
@@ -48,7 +50,7 @@ datasets = [
4850 "version": "3",
4951 "create": lambda: create_bernoulli(n_samples=1_000_000, p=0.5, seed=0),
5052 "description": "Binary sequence with 50% probability of ones and 50% probability of zeros.",
51- "tags": ["binary"],
53+ "tags": tags,
5254 "source_file": SOURCE_FILE,
5355 },
5456 ]
zia_benchmark/src/zia_benchmark/datasets/gaussian/__init__.pymodified+7−5View file
@@ -10,13 +10,15 @@ def create_gaussian(*, n_samples: int, stddev: float, seed: int) -> np.ndarray:
1010 return x
1111
1212
13+tags = ["integer", "discrete", "synthetic"]
14+
1315 datasets = [
1416 {
1517 "name": "gaussian-1",
1618 "version": "1",
1719 "create": lambda: create_gaussian(n_samples=1_000_000, stddev=1, seed=0),
1820 "description": "Rounded Gaussian integers with σ=1.",
19- "tags": [],
21+ "tags": tags,
2022 "source_file": SOURCE_FILE,
2123 },
2224 {
@@ -24,7 +26,7 @@ datasets = [
2426 "version": "1",
2527 "create": lambda: create_gaussian(n_samples=1_000_000, stddev=2, seed=0),
2628 "description": "Rounded Gaussian integers with σ=2.",
27- "tags": [],
29+ "tags": tags,
2830 "source_file": SOURCE_FILE,
2931 },
3032 {
@@ -32,7 +34,7 @@ datasets = [
3234 "version": "1",
3335 "create": lambda: create_gaussian(n_samples=1_000_000, stddev=3, seed=0),
3436 "description": "Rounded Gaussian integers with σ=3.",
35- "tags": [],
37+ "tags": tags,
3638 "source_file": SOURCE_FILE,
3739 },
3840 {
@@ -40,7 +42,7 @@ datasets = [
4042 "version": "1",
4143 "create": lambda: create_gaussian(n_samples=1_000_000, stddev=5, seed=0),
4244 "description": "Rounded Gaussian integers with σ=5.",
43- "tags": [],
45+ "tags": tags,
4446 "source_file": SOURCE_FILE,
4547 },
4648 {
@@ -48,7 +50,7 @@ datasets = [
4850 "version": "1",
4951 "create": lambda: create_gaussian(n_samples=1_000_000, stddev=8, seed=0),
5052 "description": "Rounded Gaussian integers with σ=8.",
51- "tags": [],
53+ "tags": tags,
5254 "source_file": SOURCE_FILE,
5355 },
5456 ]
zia_benchmark/src/zia_benchmark/datasets/real/__init__.pymodified+5−3View file
@@ -7,6 +7,8 @@ from ..._analysis import estimate_noise_level
77
88 SOURCE_FILE = "real/__init__.py"
99
10+tags = ["integer", "continuous", "neurophysiology", "real"]
11+
1012
1113 def _load_real_000876(
1214 *, num_samples: int, num_channels: int, start_channel: int
@@ -112,7 +114,7 @@ datasets = [
112114 "create": lambda: _load_real_000876(
113115 num_samples=500_000, num_channels=1, start_channel=45
114116 ).flatten(),
115- "tags": ["continuous", "neurophysiology"],
117+ "tags": tags,
116118 "source_file": SOURCE_FILE,
117119 },
118120 {
@@ -122,7 +124,7 @@ datasets = [
122124 "create": lambda: _load_real_000409(
123125 num_samples=500_000, num_channels=1, start_channel=101
124126 ).flatten(),
125- "tags": ["continuous", "neurophysiology"],
127+ "tags": tags,
126128 "source_file": SOURCE_FILE,
127129 },
128130 {
@@ -132,7 +134,7 @@ datasets = [
132134 "create": lambda: _load_real_001290(
133135 num_samples=500_000, num_channels=1, start_channel=0
134136 ).flatten(),
135- "tags": ["continuous", "neurophysiology"],
137+ "tags": tags,
136138 "source_file": SOURCE_FILE,
137139 },
138140 {
moveopenescclose