LangChain Integration

Use blazechunk as a LangChain TextSplitter for high-performance document chunking.

Installation

Terminal
pip install "blazechunk[langchain]"

BlazechunkTextSplitter

BlazechunkTextSplitter is a LangChain TextSplitter backed by any blazechunk chunker.

from blazechunk import TokenChunker
from blazechunk.integrations.langchain import BlazechunkTextSplitter

# Create a splitter with a custom chunker
splitter = BlazechunkTextSplitter(
    TokenChunker(chunk_size=512, chunk_overlap=64)
)

# Or use the default RecursiveChunker(chunk_size=2048)
default_splitter = BlazechunkTextSplitter()

Methods

from blazechunk import TokenChunker
from blazechunk.integrations.langchain import BlazechunkTextSplitter

splitter = BlazechunkTextSplitter(
    TokenChunker(chunk_size=512, chunk_overlap=64)
)

# Split text into strings
pieces = splitter.split_text(long_text)  # list[str]

# Create LangChain Documents
docs = splitter.create_documents([long_text])  # list[Document]
Tip
Exact byte offsets: Because blazechunk chunks are exact substrings of the source, LangChain's add_start_index=True locates each chunk reliably in the original document.