LangChain Integration
Use blazechunk as a LangChain TextSplitter for high-performance document chunking.
Installation
Terminal
pip install "blazechunk[langchain]"BlazechunkTextSplitter
BlazechunkTextSplitter is a LangChain TextSplitter backed by any blazechunk chunker.
from blazechunk import TokenChunker
from blazechunk.integrations.langchain import BlazechunkTextSplitter
# Create a splitter with a custom chunker
splitter = BlazechunkTextSplitter(
TokenChunker(chunk_size=512, chunk_overlap=64)
)
# Or use the default RecursiveChunker(chunk_size=2048)
default_splitter = BlazechunkTextSplitter()Methods
from blazechunk import TokenChunker
from blazechunk.integrations.langchain import BlazechunkTextSplitter
splitter = BlazechunkTextSplitter(
TokenChunker(chunk_size=512, chunk_overlap=64)
)
# Split text into strings
pieces = splitter.split_text(long_text) # list[str]
# Create LangChain Documents
docs = splitter.create_documents([long_text]) # list[Document]Tip
Exact byte offsets: Because blazechunk chunks are exact substrings of the source, LangChain's
add_start_index=True locates each chunk reliably in the original document.