
Aliyun Qwen Omni
- 52 installs
- 396 repo stars
- Updated July 18, 2026
- cinience/alicloud-skills
Build all-in-one multimodal understanding and generation with Alibaba Cloud Model Studio Qwen Omni models for image, audio, and text interaction.
About
Uses Model Studio Qwen Omni models for combined image, audio, and text multimodal understanding and generation. A developer uses it to build voice assistants and realtime multimodal agents.
- qwen3-omni-flash and turbo realtime model variants
- Image + audio + text assistant and realtime agent use cases
Aliyun Qwen Omni by the numbers
- 52 all-time installs (skills.sh)
- Ranked #7,086 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
- Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/cinience/alicloud-skills --skill aliyun-qwen-omniAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 52 |
|---|---|
| repo stars | ★ 396 |
| Last updated | July 18, 2026 |
| Repository | cinience/alicloud-skills ↗ |
What it does
Build all-in-one multimodal understanding and generation with Alibaba Cloud Model Studio Qwen Omni models for image, audio, and text interaction.
Files
Category: provider
Model Studio Qwen Omni
Validation
mkdir -p output/aliyun-qwen-omni
python -m py_compile skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py && echo "py_compile_ok" > output/aliyun-qwen-omni/validate.txtPass criteria: command exits 0 and output/aliyun-qwen-omni/validate.txt is generated.
Critical model names
Use one of these exact model strings:
qwen3-omni-flashqwen3-omni-flash-realtimeqwen-omni-turboqwen-omni-turbo-realtime
Typical use
- Image + audio + text assistant
- Realtime multimodal agents
- Spoken responses grounded in visual input
Normalized interface (omni.chat)
Request
model(string, optional): defaultqwen3-omni-flashtext(string, optional)image(string, optional)audio(string, optional)response_modalities(array<string>, optional): e.g.["text"],["text","audio"]
Response
text(string, optional)audio_urloraudio_chunk(optional)usage(object, optional)
Quick start
python skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py \
--output output/aliyun-qwen-omni/request.jsonReferences
references/sources.md
interface:
display_name: "Alibaba Cloud AI Multimodal Qwen Omni"
short_description: "All-in-one multimodal interaction with Qwen Omni"
default_prompt: "Use $aliyun-qwen-omni to complete this ai/multimodal omni task on Alibaba Cloud."
Sources
- https://help.aliyun.com/zh/model-studio/qwen-omni
- https://help.aliyun.com/zh/model-studio/newly-released-models
#!/usr/bin/env python3
"""Prepare a minimal request payload for Qwen Omni."""
from __future__ import annotations
import argparse
import json
from pathlib import Path
DEFAULT_PAYLOAD = {
"model": "qwen3-omni-flash",
"text": "Describe the input briefly and answer in Chinese.",
"image": "https://example.com/demo.jpg",
"response_modalities": ["text"],
}
def main() -> None:
parser = argparse.ArgumentParser()
parser.add_argument(
"--output",
default="output/aliyun-qwen-omni/request.json",
)
args = parser.parse_args()
output = Path(args.output)
output.parent.mkdir(parents=True, exist_ok=True)
output.write_text(json.dumps(DEFAULT_PAYLOAD, ensure_ascii=False, indent=2), encoding="utf-8")
print(output)
if __name__ == "__main__":
main()