@@ -61,9 +61,9 @@ bash scripts/02_clean_data.sh \
6161
6262| Parameter | Required | Description | Default |
6363| -----------| ----------| -------------| ---------|
64- | ` --input ` | ✓ | Input CSV file or directory (docx/txt) | - |
65- | ` --language ` | ✓ (not for preview) | Data language: english, chinese, german, spanish | - |
66- | ` --text_column ` | ✓ (CSV mode) | Name of the text column to clean | - |
64+ | ` --input ` | Yes | Input CSV file or directory (docx/txt) | - |
65+ | ` --language ` | Yes (not for preview) | Data language: english, chinese, german, spanish | - |
66+ | ` --text_column ` | Yes (CSV mode) | Name of the text column to clean | - |
6767| ` --label_columns ` | | Comma-separated label/metadata columns to keep as-is | - |
6868| ` --keep_all ` | | Keep ALL original columns (only text column is cleaned) | false |
6969| ` --preview ` | | Show CSV columns and sample rows, then exit | false |
@@ -149,8 +149,8 @@ bash scripts/03_prepare_data.sh --dataset mydata \
149149
150150| Parameter | Required | Description | Default |
151151| -----------| ----------| -------------| ---------|
152- | ` --dataset ` | ✓ | Dataset name | - |
153- | ` --model ` | ✓ | Target model: lda, hdp, stm (requires covariates), btm, nvdm, gsm, prodlda, ctm, etm, dtm, bertopic, theta | - |
152+ | ` --dataset ` | Yes | Dataset name | - |
153+ | ` --model ` | Yes | Target model: lda, hdp, stm (requires covariates), btm, nvdm, gsm, prodlda, ctm, etm, dtm, bertopic, theta | - |
154154| ` --model_size ` | | Qwen model size (theta only): 0.6B, 4B, 8B | 0.6B |
155155| ` --mode ` | | Embedding mode (theta only): zero_shot, unsupervised, supervised | zero_shot |
156156| ` --vocab_size ` | | Vocabulary size | 5000 |
@@ -235,7 +235,7 @@ bash scripts/04_train_theta.sh \
235235
236236| Parameter | Required | Description | Default |
237237| -----------| ----------| -------------| ---------|
238- | ` --dataset ` | ✓ | Dataset name | - |
238+ | ` --dataset ` | Yes | Dataset name | - |
239239| ` --model_size ` | | Qwen model size: 0.6B, 4B, 8B | 0.6B |
240240| ` --mode ` | | Embedding mode: zero_shot, unsupervised, supervised | zero_shot |
241241| ` --num_topics ` | | Number of topics K | 20 |
@@ -467,8 +467,8 @@ bash scripts/05_train_baseline.sh \
467467
468468| Parameter | Required | Description | Default |
469469| -----------| ----------| -------------| ---------|
470- | ` --dataset ` | ✓ | Dataset name | - |
471- | ` --models ` | ✓ | Model list (comma-separated) | - |
470+ | ` --dataset ` | Yes | Dataset name | - |
471+ | ` --models ` | Yes | Model list (comma-separated) | - |
472472| ` --num_topics ` | | Number of topics (ignored for hdp/bertopic) | 20 |
473473| ` --vocab_size ` | | Vocabulary size | 5000 |
474474| ` --epochs ` | | Training epochs (neural models) | 100 |
0 commit comments