Here's the corrected command to build the index:
docker run --rm -it
--runtime=nvidia
-e NVIDIA_VISIBLE_DEVICES=all
--network llm-net
-v "$(pwd)/data:/app/data"
-v "$(pwd)/.doctr_cache:/root/.cache/doctr"
-v "$(pwd)/src:/app/src"
textstruct
python src/main.py
"/app/data/input/Ncert textbooks/Grade 6/Mathemathics/fegp1dd.zip"
--fast
--layout-aware
--refine
--semantic-chunk
--classify-roles
--classify-roles-llm
--fix-math
--fix-math-ollama
--build-index
After building the index, you can query it interactively with:
docker run --rm -it
--runtime=nvidia
-e NVIDIA_VISIBLE_DEVICES=all
--network llm-net
-v "$(pwd)/data:/app/data"
-v "$(pwd)/.doctr_cache:/root/.cache/doctr"
-v "$(pwd)/src:/app/src"
textstruct
python src/query.py
/app/data/output/fegp1dd/vector_store.pkl
--interactive
Or for a single query:
docker run --rm -it
--runtime=nvidia
-e NVIDIA_VISIBLE_DEVICES=all
--network llm-net
-v "$(pwd)/data:/app/data"
-v "$(pwd)/.doctr_cache:/root/.cache/doctr"
-v "$(pwd)/src:/app/src"
textstruct
python src/query.py
/app/data/output/fegp1dd/vector_store.pkl
--query "What is a triangle?"
--role definition
--top-k 3