interface FishAudioOptions {
    chunk_length?: number;
    condition_on_previous_chunks?: boolean;
    early_stop_threshold?: number;
    latency?: "low" | "balanced" | "normal";
    max_new_tokens?: number;
    min_chunk_length?: number;
    normalize?: boolean;
    normalize_loudness?: boolean;
    speed?: number;
    temperature?: number;
    top_p?: number;
    volume?: number;
}

Properties

chunk_length?: number

Characters buffered before auto-synthesis, range 100-300.

condition_on_previous_chunks?: boolean

Use prior audio as context for consistency.

early_stop_threshold?: number

Early-stopping threshold for batching, range 0-1.

latency?: "low" | "balanced" | "normal"

Streaming latency mode.

max_new_tokens?: number

Max audio tokens per text chunk, default 1024.

min_chunk_length?: number

Min characters before splitting a new chunk, range 0-100.

normalize?: boolean

Normalize numbers/dates/abbreviations before synthesis.

normalize_loudness?: boolean

Consistent output loudness; S2-Pro family only.

speed?: number

Prosody speaking-rate multiplier, 1.0 is natural.

temperature?: number

Range 0-1, higher is more varied/expressive.

top_p?: number

Nucleus sampling probability mass, range 0-1.

volume?: number

Prosody loudness adjustment in dB, 0 is natural.