Now liveThe Skillselion MCP - thousands of ranked skills, loaded into your agent mid-task. No install.Get it →
cinience avatar

Alicloud Ai Multimodal Qwen Omni

  • 93 installs
  • 396 repo stars
  • Updated July 18, 2026
  • cinience/alicloud-skills

Prepares all-in-one multimodal requests for Alibaba Cloud Model Studio Qwen Omni models for image-plus-audio interaction and realtime multimodal agents.

About

Builds multimodal understanding and generation requests against Alibaba Cloud Model Studio Qwen Omni models. A developer uses it for image-plus-audio interaction, voice assistants, and realtime multimodal agents.

  • Targets Qwen Omni all-in-one multimodal models
  • Includes py_compile validation and evidence output

Alicloud Ai Multimodal Qwen Omni by the numbers

  • 93 all-time installs (skills.sh)
  • Ranked #4,673 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
  • Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/cinience/alicloud-skills --skill alicloud-ai-multimodal-qwen-omni

Add your badge

Show developers this skill is listed on Skillselion. Paste this into your README.

Listed on Skillselion
Installs93
repo stars396
Last updatedJuly 18, 2026
Repositorycinience/alicloud-skills

What it does

Prepares all-in-one multimodal requests for Alibaba Cloud Model Studio Qwen Omni models for image-plus-audio interaction and realtime multimodal agents.

Files

SKILL.mdMarkdownGitHub ↗

Category: provider

Model Studio Qwen Omni

Validation

mkdir -p output/alicloud-ai-multimodal-qwen-omni
python -m py_compile skills/ai/multimodal/alicloud-ai-multimodal-qwen-omni/scripts/prepare_omni_request.py && echo "py_compile_ok" > output/alicloud-ai-multimodal-qwen-omni/validate.txt

Pass criteria: command exits 0 and output/alicloud-ai-multimodal-qwen-omni/validate.txt is generated.

Critical model names

Use one of these exact model strings:

  • qwen3-omni-flash
  • qwen3-omni-flash-realtime
  • qwen-omni-turbo
  • qwen-omni-turbo-realtime

Typical use

  • Image + audio + text assistant
  • Realtime multimodal agents
  • Spoken responses grounded in visual input

Normalized interface (omni.chat)

Request

  • model (string, optional): default qwen3-omni-flash
  • text (string, optional)
  • image (string, optional)
  • audio (string, optional)
  • response_modalities (array<string>, optional): e.g. ["text"], ["text","audio"]

Response

  • text (string, optional)
  • audio_url or audio_chunk (optional)
  • usage (object, optional)

Quick start

python skills/ai/multimodal/alicloud-ai-multimodal-qwen-omni/scripts/prepare_omni_request.py \
  --output output/alicloud-ai-multimodal-qwen-omni/request.json

References

  • references/sources.md

Related skills

This week in AI coding

Five minutes, every Monday - the tools, releases and tactics for developers.

unsubscribe anytime.