我們把客服對話導到 Qwen3.5 35B A3B API,延遲降到客服都感覺不到模型在環裡。
Qwen3.5 35B A3B 是阿里 Qwen 出品的專家混合對話模型,35B 總參數、約 3B 啟用,快速低成本,適合對話、程式設計與多語言場景。在 RouterBase 上透過相容 OpenAI 的端點提供,輸入 $0.213 / 1M、輸出 $1.70 / 1M,比標準價低 15%。
Qwen3.5 35B A3B API —— 高效 MoE,3B 啟用
Qwen3.5 35B A3B API 執行 35B 總參數、約 3B 啟用的 Qwen3.5 專家混合模型,面向快速、低成本的對話、程式設計與多語言場景。
Qwen3.5 35B A3B API 提供 Alibaba Qwen3.5 35B A3B,一個 350 億總參數、每個 token 只啟用約 30 億的專家混合(MoE)大語言模型。路由器在推理的每一步只挑選一小部分最相關的專家參與計算,因此模型以小網路的延遲與成本作答,卻能調用大得多的知識儲備。這種平衡讓 Qwen3.5 35B A3B API 非常適合高並發對話、草稿撰寫、摘要、程式輔助與多語言助手,在高頻呼叫裡,速度與單價的平衡正是這類稀疏架構模型的核心價值所在。
你透過 RouterBase、以 OpenAI chat-completions 協定存取 Qwen3.5 35B A3B API,現有用戶端指過來即可原樣運作,一把金鑰覆蓋整個目錄。按 token 計費,每百萬輸入 token $0.213、每百萬輸出 token $1.70,比 $0.25 / $2.00 的標價低 15%,無每請求費。串流輸出與標準工具呼叫讓你把該 API 接進代理、IDE 助手或批次流水線,對話歷史與結構化輸出都走同一個端點,而不用寫任何廠商專屬的膠水程式碼,每一次呼叫的用量與費用都能在控制台裡一目了然地看到。
Qwen3.5 35B A3B API 給你什麼
大模型的知識,小模型的成本。
高效 MoE 設計
Qwen3.5 35B A3B API 跑一個 35B 總參數、約 3B 啟用的專家混合網路,回答既有深度,又不用付出稠密模型的延遲。
Qwen3.5 世代
基於 Qwen3.5 系列,模型的指令遵循與推理都比早期緊湊版 Qwen 更強,端點形態保持不變。
快且省
每個 token 只啟用一小部分參數,Qwen3.5 35B A3B API 延遲低,輸入 $0.213、輸出 $1.70,比標價低 15%。
多語言對話
模型覆蓋英語、中文等多種語言,Qwen3.5 35B A3B API 適合多語言助手、翻譯與客服支援。
工具與 JSON
Qwen3.5 35B A3B API 以標準 OpenAI 模式回傳函式呼叫與結構化 JSON,適配代理與資料流水線。
串流、按 token
回應隨生成分塊串流回傳,按 token 計費,無請求費,成本隨用隨見。

三步完成對 Qwen3.5 35B A3B API 的首次呼叫
接一次線,之後隨意串流。
建立金鑰
一把 RouterBase 金鑰即可存取 Qwen3.5 35B A3B API 及目錄裡的每個模型,沒有廠商專屬的東西要設定。
指向用戶端
把任意 OpenAI 用戶端發往 routerbase.com/v1,model=qwen/qwen3.5-35b-a3b,帶上 messages 陣列;Qwen3.5 35B A3B API 在同樣的 chat-completions 形態上作答。
串流並盯用量
模型隨生成串流回傳 token,並按回應回傳用量,因此每次呼叫 Qwen3.5 35B A3B API 的成本與延遲都可見。
按使用量付費
RouterBase 透傳合作方價格,與模型官方公開 API 價格對比。
按使用量付費
RouterBase 透傳合作方價格,與模型官方公開 API 價格對比。
| 解析度 | RouterBase | 官方 | 節省 |
|---|---|---|---|
| Input (per 1M) | $0.213 | −15% | |
| Output (per 1M) | $1.700 | −15% |
預設配置(Input (per 1M))單次呼叫 $0.213。$1 大約可以呼叫本模型 4 次。
官方價 = Alibaba Qwen 對 Qwen3.5 35B A3B 的標價(每百萬輸入 $0.25、每百萬輸出 $2.00)。RouterBase 以 $0.213 / $1.70 提供 Qwen3.5 35B A3B API,比標價低 15%。
正在基於 Qwen3.5 35B A3B API 建構的團隊
小模型成本,大模型知識。
輸入 $0.213、輸出 $1.70,Qwen3.5 35B A3B API 讓我們把摘要量翻三倍而預算不動。
3B 啟用是關鍵——Qwen3.5 35B A3B API 答得像更大的模型,卻幾乎瞬間流回。
函式呼叫按標準模式回傳,我們的代理棧在 Qwen3.5 35B A3B API 上零自訂解析地跑了起來。
我們對每個版本都做基準,Qwen3.5 35B A3B API 在當前技術棧裡性價比最高。
從稠密模型切到 Qwen3.5 35B A3B API 只改了一個字串,草稿工具明顯更跟手了。
多語言回答同樣出色,這就是我們的在地化聊天今天跑在 Qwen3.5 35B A3B API 上的原因。
從 Qwen3.5 35B A3B API 串流很順,我們的 UI 逐 token 渲染,無需額外緩衝。
過去要大模型才能搞定的 JSON 抽取任務,現在在 Qwen3.5 35B A3B API 上用零頭成本就能過。
Qwen3.5 35B A3B API —— 常見問題
把流量導過來之前該知道的。
它是 RouterBase 對 Alibaba Qwen3.5 35B A3B 的託管接入——一個 35B 總參數、約 3B 啟用的專家混合對話模型,透過相容 OpenAI 的端點提供。