
Alicloud Ai Multimodal Qwen Omni
- 93 installs
- 396 repo stars
- Updated July 18, 2026
- cinience/alicloud-skills
Prepares all-in-one multimodal requests for Alibaba Cloud Model Studio Qwen Omni models for image-plus-audio interaction and realtime multimodal agents.
About
Builds multimodal understanding and generation requests against Alibaba Cloud Model Studio Qwen Omni models. A developer uses it for image-plus-audio interaction, voice assistants, and realtime multimodal agents.
- Targets Qwen Omni all-in-one multimodal models
- Includes py_compile validation and evidence output
Alicloud Ai Multimodal Qwen Omni by the numbers
- 93 all-time installs (skills.sh)
- Ranked #4,673 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
- Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/cinience/alicloud-skills --skill alicloud-ai-multimodal-qwen-omniAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 93 |
|---|---|
| repo stars | ★ 396 |
| Last updated | July 18, 2026 |
| Repository | cinience/alicloud-skills ↗ |
What it does
Prepares all-in-one multimodal requests for Alibaba Cloud Model Studio Qwen Omni models for image-plus-audio interaction and realtime multimodal agents.
Files
Category: provider
Model Studio Qwen Omni
Validation
mkdir -p output/alicloud-ai-multimodal-qwen-omni
python -m py_compile skills/ai/multimodal/alicloud-ai-multimodal-qwen-omni/scripts/prepare_omni_request.py && echo "py_compile_ok" > output/alicloud-ai-multimodal-qwen-omni/validate.txtPass criteria: command exits 0 and output/alicloud-ai-multimodal-qwen-omni/validate.txt is generated.
Critical model names
Use one of these exact model strings:
qwen3-omni-flashqwen3-omni-flash-realtimeqwen-omni-turboqwen-omni-turbo-realtime
Typical use
- Image + audio + text assistant
- Realtime multimodal agents
- Spoken responses grounded in visual input
Normalized interface (omni.chat)
Request
model(string, optional): defaultqwen3-omni-flashtext(string, optional)image(string, optional)audio(string, optional)response_modalities(array<string>, optional): e.g.["text"],["text","audio"]
Response
text(string, optional)audio_urloraudio_chunk(optional)usage(object, optional)
Quick start
python skills/ai/multimodal/alicloud-ai-multimodal-qwen-omni/scripts/prepare_omni_request.py \
--output output/alicloud-ai-multimodal-qwen-omni/request.jsonReferences
references/sources.md
interface:
display_name: "Alibaba Cloud AI Multimodal Qwen Omni"
short_description: "All-in-one multimodal interaction with Qwen Omni"
default_prompt: "Use $alicloud-ai-multimodal-qwen-omni to complete this ai/multimodal omni task on Alibaba Cloud."
Sources
- https://help.aliyun.com/zh/model-studio/qwen-omni
- https://help.aliyun.com/zh/model-studio/newly-released-models
#!/usr/bin/env python3
"""Prepare a minimal request payload for Qwen Omni."""
from __future__ import annotations
import argparse
import json
from pathlib import Path
DEFAULT_PAYLOAD = {
"model": "qwen3-omni-flash",
"text": "Describe the input briefly and answer in Chinese.",
"image": "https://example.com/demo.jpg",
"response_modalities": ["text"],
}
def main() -> None:
parser = argparse.ArgumentParser()
parser.add_argument(
"--output",
default="output/alicloud-ai-multimodal-qwen-omni/request.json",
)
args = parser.parse_args()
output = Path(args.output)
output.parent.mkdir(parents=True, exist_ok=True)
output.write_text(json.dumps(DEFAULT_PAYLOAD, ensure_ascii=False, indent=2), encoding="utf-8")
print(output)
if __name__ == "__main__":
main()