Skip to main content

Model Constraints

Some models have rules about their input — a max audio length, a fixed image size, or "exactly one face per query". If you break one, you get a clear error. Here's what to watch for per family.

Audio Models (CLAP)​

ConstraintValueNotes
Max duration10 minutes (600 seconds)Longer clips will error with AudioTooLongError
Sample rate48 kHzAudio is automatically resampled
Max samples28,800,00048,000 Hz × 600 seconds
Chunk size10 secondsLong audio is automatically split into overlapping chunks
Chunk overlap1 secondProvides temporal continuity between chunks
Embedding modeOneToManyReturns one embedding per chunk with temporal metadata
PreprocessingRequiredNoPreprocessing not supported - always use ModelPreprocessing

Audio chunking behavior:

  • Audio ≤10 seconds: Returns 1 embedding
  • Audio >10 seconds: Automatically chunked into 10-second segments with 1-second overlap
  • Each chunk embedding includes metadata: chunk_start_sec, chunk_end_sec, chunk_duration_sec, total_chunks, audio_total_duration_sec

Face Models (Buffalo_L, SFace+YuNet)​

ConstraintValueNotes
Input size640x640 pxImages are resized internally
Face alignment112x112 pxStandard ArcFace alignment
Embedding modeOneToManyReturns one embedding per detected face
PreprocessingRequiredNoPreprocessing not supported
Query constraintSingle faceQuery images must contain exactly 1 face

Cross-modal pairs​

Certain text and media encoders share a dimension so you can search across modalities — see Cross-modal pairs on the Models page.