Qwen3 ASR Speech Recognition
qwen3-asr-flash converts audio to text through the OpenAI-compatible Chat Completions API. Put the audio in messages[].content[].
Endpoint
POST /v1/chat/completionsFull URL:
https://cubicspaces.cloud/v1/chat/completionsSupported Model
| Model | Description |
|---|---|
qwen3-asr-flash | Speech recognition for short audio |
Actual availability depends on your account permissions and platform configuration.
Quick Start
You can provide a publicly accessible audio URL:
curl https://cubicspaces.cloud/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-asr-flash",
"messages": [
{
"role": "user",
"content": [
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/audio.mp3"
}
}
]
}
],
"asr_options": {
"language": "en",
"enable_itn": true
},
"stream": false
}'Request Fields
| Field | Type | Required | Description |
|---|---|---|---|
model | string | Yes | Must be qwen3-asr-flash |
messages | array | Yes | OpenAI Chat message array |
messages[].role | string | Yes | Use user for the audio message |
messages[].content | array | Yes | Multimodal content array |
content[].type | string | Yes | Must be input_audio |
content[].input_audio.data | string | Yes | Public audio URL or Base64 Data URI |
asr_options.language | string | No | Language code when the audio language is known |
asr_options.enable_itn | boolean | No | Converts spoken numbers to digits; default is false |
stream | boolean | No | Enables SSE streaming; default is false |
stream_options.include_usage | boolean | No | Returns usage at the end of a streaming response |
asr_options belongs at the top level of the request body. Do not place it inside messages or input_audio.
Common language codes include:
zh: Chinese (Mandarin, Sichuanese, Minnan, and Wu)yue: Cantoneseen: Englishja: Japanesede,ko,ru,fr,pt,ar,it,eshi,id,th,tr,uk,vi,cs,da,fil,fi,is,ms,no,pl,sv
Omit language when the audio is multilingual or the language is unknown.
Base64 Audio
Convert a local file to a Data URI:
import base64
from pathlib import Path
audio = Path("audio.mp3").read_bytes()
audio_data = "data:audio/mpeg;base64," + base64.b64encode(audio).decode()Then pass audio_data as input_audio.data.
Response Example
Read the transcript from choices[0].message.content:
{
"id": "chatcmpl_123",
"object": "chat.completion",
"model": "qwen3-asr-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "Welcome to Cubicspaces."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 45,
"completion_tokens": 12,
"total_tokens": 57,
"seconds": 1
}
}| Response Field | Description |
|---|---|
choices[0].message.content | Recognized text |
usage.prompt_tokens | Input usage |
usage.completion_tokens | Output text usage |
usage.total_tokens | Total token usage |
usage.seconds | Input audio duration in seconds |
SDK Examples
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://cubicspaces.cloud/v1"
)
response = client.chat.completions.create(
model="qwen3-asr-flash",
messages=[
{
"role": "user",
"content": [
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/audio.mp3"
}
}
]
}
],
extra_body={
"asr_options": {
"language": "en",
"enable_itn": True
}
}
)
print(response.choices[0].message.content)
print(response.usage)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "YOUR_API_KEY",
baseURL: "https://cubicspaces.cloud/v1"
});
const response = await client.chat.completions.create({
model: "qwen3-asr-flash",
messages: [
{
role: "user",
content: [
{
type: "input_audio",
input_audio: {
data: "https://example.com/audio.mp3"
}
}
]
}
],
asr_options: {
language: "en",
enable_itn: true
}
});
console.log(response.choices[0].message.content);
console.log(response.usage);Streaming
With stream: true, the response uses OpenAI-compatible SSE. Text chunks appear in choices[0].delta.content. To receive usage.seconds at the end, also set:
{
"stream": true,
"stream_options": {
"include_usage": true
}
}The final event that contains usage may have an empty choices array. Check the array before reading a delta.
Limits and Notes
- Maximum audio duration: 5 minutes. Maximum file size: 10 MB.
- Audio URLs must be directly accessible from the public internet without authentication.
- Base64 input must include a valid Data URI prefix, such as
data:audio/mpeg;base64,. - The API returns recognized text but does not return sentence-level or word-level timestamps.
- Use
/v1/chat/completions.
Troubleshooting
Model unavailable
Make sure model is qwen3-asr-flash, then contact your platform administrator to confirm account access.
Audio cannot be read
Make sure the URL is anonymously accessible, or use a Base64 Data URI. Verify that the audio is within the duration and file-size limits.
Invalid request body
Make sure content is an array, the audio object uses type: "input_audio", and asr_options is at the top level.