Spaces:
Build error
Build error
Download vectorize_documents.py from 0504ankitsharma/Chatbot: direct link, hf CLI and curl.
- Browser
- Download file 850 Bytes
-
https://huggingface.co/spaces/0504ankitsharma/Chatbot/resolve/main/vectorize_documents.py
- Command line
-
hf download hf://spaces/0504ankitsharma/Chatbot/vectorize_documents.py
-
curl -L -o vectorize_documents.py https://huggingface.co/spaces/0504ankitsharma/Chatbot/resolve/main/vectorize_documents.py
850 Bytes
| from langchain_community.document_loaders import UnstructuredFileLoader | |
| from langchain_community.document_loaders import DirectoryLoader | |
| from langchain_text_splitters import CharacterTextSplitter | |
| from langchain_huggingface import HuggingFaceEmbeddings | |
| from langchain_chroma import Chroma | |
| # loaidng the embedding model | |
| embeddings = HuggingFaceEmbeddings() | |
| loader = DirectoryLoader(path="data", | |
| glob="./*.pdf", | |
| loader_cls=UnstructuredFileLoader) | |
| documents = loader.load() | |
| text_splitter = CharacterTextSplitter(chunk_size=2000, | |
| chunk_overlap=500) | |
| text_chunks = text_splitter.split_documents(documents) | |
| vectordb = Chroma.from_documents( | |
| documents=text_chunks, | |
| embedding=embeddings, | |
| persist_directory="vector_db_dir" | |
| ) | |
| print("Documents Vectorized") | |