Now liveThe Skillselion MCP - thousands of ranked skills, loaded into your agent mid-task. No install.Get it →
cinience avatar

Aliyun Qwen Omni

  • 52 installs
  • 396 repo stars
  • Updated July 18, 2026
  • cinience/alicloud-skills

Build all-in-one multimodal understanding and generation with Alibaba Cloud Model Studio Qwen Omni models for image, audio, and text interaction.

About

Uses Model Studio Qwen Omni models for combined image, audio, and text multimodal understanding and generation. A developer uses it to build voice assistants and realtime multimodal agents.

  • qwen3-omni-flash and turbo realtime model variants
  • Image + audio + text assistant and realtime agent use cases

Aliyun Qwen Omni by the numbers

  • 52 all-time installs (skills.sh)
  • Ranked #7,086 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
  • Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/cinience/alicloud-skills --skill aliyun-qwen-omni

Add your badge

Show developers this skill is listed on Skillselion. Paste this into your README.

Listed on Skillselion
Installs52
repo stars396
Last updatedJuly 18, 2026
Repositorycinience/alicloud-skills

What it does

Build all-in-one multimodal understanding and generation with Alibaba Cloud Model Studio Qwen Omni models for image, audio, and text interaction.

Files

SKILL.mdMarkdownGitHub ↗

Category: provider

Model Studio Qwen Omni

Validation

mkdir -p output/aliyun-qwen-omni
python -m py_compile skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py && echo "py_compile_ok" > output/aliyun-qwen-omni/validate.txt

Pass criteria: command exits 0 and output/aliyun-qwen-omni/validate.txt is generated.

Critical model names

Use one of these exact model strings:

  • qwen3-omni-flash
  • qwen3-omni-flash-realtime
  • qwen-omni-turbo
  • qwen-omni-turbo-realtime

Typical use

  • Image + audio + text assistant
  • Realtime multimodal agents
  • Spoken responses grounded in visual input

Normalized interface (omni.chat)

Request

  • model (string, optional): default qwen3-omni-flash
  • text (string, optional)
  • image (string, optional)
  • audio (string, optional)
  • response_modalities (array<string>, optional): e.g. ["text"], ["text","audio"]

Response

  • text (string, optional)
  • audio_url or audio_chunk (optional)
  • usage (object, optional)

Quick start

python skills/ai/multimodal/aliyun-qwen-omni/scripts/prepare_omni_request.py \
  --output output/aliyun-qwen-omni/request.json

References

  • references/sources.md

Related skills

This week in AI coding

Five minutes, every Monday - the tools, releases and tactics for developers.

unsubscribe anytime.