From 92a0131a2cbb076cb4e43e58cd122106234102a2 Mon Sep 17 00:00:00 2001 From: Robrecht Cannoodt Date: Tue, 30 Sep 2025 10:12:16 +0200 Subject: [PATCH 1/5] add dataset processing script --- .../human_cll_mass_cytometry.sh | 40 +++++++++++++++++++ 1 file changed, 40 insertions(+) create mode 100755 scripts/create_resources/human_cll_mass_cytometry.sh diff --git a/scripts/create_resources/human_cll_mass_cytometry.sh b/scripts/create_resources/human_cll_mass_cytometry.sh new file mode 100755 index 00000000..ccc39002 --- /dev/null +++ b/scripts/create_resources/human_cll_mass_cytometry.sh @@ -0,0 +1,40 @@ +#!/bin/bash + +# get the root of the directory +REPO_ROOT=$(git rev-parse --show-toplevel) + +# ensure that the command below is run from the root of the repository +cd "$REPO_ROOT" + +set -e + +RAW_DIR=resources_raw/human_cll_mass_cytometry/ +DATASET_ID=human_cll_mass_cytometry +OUTPUT_DIR=resources/datasets_raw/$DATASET_ID/ + +mkdir -p $OUTPUT_DIR + +# create raw dataset files +python << HERE +import anndata as ad + +adata = ad.read_h5ad("$RAW_DIR/human_cll_mass_cytometry.h5ad") + +# rename values +for col in ["parameter_num_clusters", "parameter_som_xdim", "parameter_som_ydim"]: + adata.uns[col] = int(adata.uns[col]) + +# make sure the output is compressed +adata.write_h5ad("$OUTPUT_DIR/common_dataset.h5ad", compression='gzip') +HERE + +cat > $OUTPUT_DIR/state.yaml << HERE +id: $DATASET_ID +output_dataset: !file common_dataset.h5ad +HERE + +# only run this if you have access to the openproblems-data bucket +aws s3 sync --profile op \ + resources/datasets_raw/human_cll_mass_cytometry \ + s3://openproblems-data/resources/task_cyto_batch_integration/datasets_raw/human_cll_mass_cytometry/ \ + --delete --dryrun From e87bc73b680a481ef1c8baf3aba03ab52d996163 Mon Sep 17 00:00:00 2001 From: Robrecht Cannoodt Date: Tue, 30 Sep 2025 10:28:04 +0200 Subject: [PATCH 2/5] fix reference --- scripts/create_resources/human_cll_mass_cytometry.sh | 2 ++ 1 file changed, 2 insertions(+) diff --git a/scripts/create_resources/human_cll_mass_cytometry.sh b/scripts/create_resources/human_cll_mass_cytometry.sh index ccc39002..7f445d56 100755 --- a/scripts/create_resources/human_cll_mass_cytometry.sh +++ b/scripts/create_resources/human_cll_mass_cytometry.sh @@ -24,6 +24,8 @@ adata = ad.read_h5ad("$RAW_DIR/human_cll_mass_cytometry.h5ad") for col in ["parameter_num_clusters", "parameter_som_xdim", "parameter_som_ydim"]: adata.uns[col] = int(adata.uns[col]) +adata.uns["dataset_reference"] = "10.1016/j.cell.2020.12.002" + # make sure the output is compressed adata.write_h5ad("$OUTPUT_DIR/common_dataset.h5ad", compression='gzip') HERE From cc03dc7e6820b6ca99c447d1d5334d889267286b Mon Sep 17 00:00:00 2001 From: Givanna Putri Date: Tue, 30 Sep 2025 19:41:06 +1000 Subject: [PATCH 3/5] add goal batch --- scripts/create_resources/human_cll_mass_cytometry.sh | 3 +++ 1 file changed, 3 insertions(+) diff --git a/scripts/create_resources/human_cll_mass_cytometry.sh b/scripts/create_resources/human_cll_mass_cytometry.sh index 7f445d56..cd2bdf93 100755 --- a/scripts/create_resources/human_cll_mass_cytometry.sh +++ b/scripts/create_resources/human_cll_mass_cytometry.sh @@ -26,6 +26,9 @@ for col in ["parameter_num_clusters", "parameter_som_xdim", "parameter_som_ydim" adata.uns["dataset_reference"] = "10.1016/j.cell.2020.12.002" +# set goal batch to batch 1 +adata.uns["goal_batch"] = 1 + # make sure the output is compressed adata.write_h5ad("$OUTPUT_DIR/common_dataset.h5ad", compression='gzip') HERE From ae515804f021c820d26e62184d50a38041816bf1 Mon Sep 17 00:00:00 2001 From: Givanna Putri Date: Tue, 7 Oct 2025 22:28:06 +1100 Subject: [PATCH 4/5] update script for cll dataset --- scripts/create_resources/human_cll_mass_cytometry.sh | 9 --------- 1 file changed, 9 deletions(-) diff --git a/scripts/create_resources/human_cll_mass_cytometry.sh b/scripts/create_resources/human_cll_mass_cytometry.sh index cd2bdf93..f3271e15 100755 --- a/scripts/create_resources/human_cll_mass_cytometry.sh +++ b/scripts/create_resources/human_cll_mass_cytometry.sh @@ -20,15 +20,6 @@ import anndata as ad adata = ad.read_h5ad("$RAW_DIR/human_cll_mass_cytometry.h5ad") -# rename values -for col in ["parameter_num_clusters", "parameter_som_xdim", "parameter_som_ydim"]: - adata.uns[col] = int(adata.uns[col]) - -adata.uns["dataset_reference"] = "10.1016/j.cell.2020.12.002" - -# set goal batch to batch 1 -adata.uns["goal_batch"] = 1 - # make sure the output is compressed adata.write_h5ad("$OUTPUT_DIR/common_dataset.h5ad", compression='gzip') HERE From 81d2cc271ff79be54910252dbc525d1c554322fb Mon Sep 17 00:00:00 2001 From: Givanna Putri Date: Thu, 9 Oct 2025 19:08:34 +1100 Subject: [PATCH 5/5] update changelog --- CHANGELOG.md | 1 + 1 file changed, 1 insertion(+) diff --git a/CHANGELOG.md b/CHANGELOG.md index d2348383..7ec49cbd 100644 --- a/CHANGELOG.md +++ b/CHANGELOG.md @@ -64,6 +64,7 @@ * Added Seurat rPCA (PR #95). +* Added processing scripts for CLL dataset (PR #106). ## MAJOR CHANGES