自研 AOQ 协议,为多模态 AI 构建确定性传输底座

简介: AOQ(AI Over QUIC)是专为多模态AI设计的自研传输协议,首创“实时+非实时”双模自适应机制,支持文本、音视频、文件全格式统一承载与强同步。基于QUIC深度优化,具备0-RTT建连、流级容错、智能带宽调度等能力,60%高丢包下仍保障流畅交互,突破弱网瓶颈,实现低延迟、高可靠、强同步三者兼得。

一、前言

  • 随着大模型向多模态全面演进,AI 应用正从云端走向终端。端侧公网“最后一公里”的网络波动与 AI 推理所需要海量数据的实时传输需求之间,存在较大的冲突,会使得模型的推理效果以及用户体验大打折扣。
  • 为了解决这一问题,自研了AOQ(AI Over Quic) 协议,支持文本、音视频、文件的全格式统一承载。为了更加贴合多模态模型的数据生产和消费特点,更创新性地实现了“实时/非实时”双模自适应,旨在极端弱网环境下为多模态模型提供确定性的低延迟与高可靠体验,做到多模态模型体验的技术领先性。

二、多模态 AI 双工交互对传输协议的“升维考验”

多模态大模型通话场景,迫使网络传输协议直面两个“近似冲突”的硬性挑战:

  • 端侧弱网低延时:地铁、电梯等场景下,高丢包、大抖动、带宽骤降成为常态。弱网导致的卡顿和连接中断,会瞬间击穿用户对 AI 交互的耐心。
  • 数据异构强对齐:AI 交互混合了指令、音视频、长文本等异构载体。传统实时协议为保流畅常牺牲可靠性,导致数据截断;同时,多通道独立传输缺乏协同,极易引发口型、声音与字幕脱节。

简言之,两个挑战分别要求网络传输具备实时性和可靠性、同步性,三者构成的“不可能三角”令经典传输协议顾此失彼。


弱网实时

内容可靠有序

多载体强同步

用户感受

传统可靠协议

“太慢太卡”

传统实时协议

“能到,交互形式单一”

AOQ

“能到,交互丰富”

AOQ基于QUIC协议的底层优势,参考传统实时协议的优化手段,针对AI多模态数据的复杂特性进行了深度定制与重构,实现了实时、可靠和同步的三者兼得。通过实测对比,AOQ相比于经典协议(如可靠协议WebSocket及实时协议WebRTC),展现了全方位能力提升。

image.png

三、AOQ的破局与核心优势

针对AI全双工业务,AOQ协议抽象出物理层、传输层、模型对接层与应用层,逐层深度优化适配,在全格式承载能力、AI业务模式适配、极致弱网对抗、多流协同同步等维度上实现了代际跨越。

image.png

1. 全格式原生承载:打破协议壁垒,实现“一链通传”

  • 混合流量一体化:在单 QUIC 连接内,AOQ 原生支持文本指令、语音消息、图片、大体积文件、实时流媒体的并行传输。
  • 多模态时序强同步:即使模型异步生成音频、视频、文本存在速度差异,AOQ 仍可依据全局时钟同步与关联映射机制,完成强制同步和映射,避免出现音画不同步、图文错位等现象。
  • 交互全链路加密:全格式数据原生加密,无论控制指令、文本、文件,抑或实时音视频、图片,均全时段密文传输,确保端云双向的隐私安全与防劫持能力。
  • 多模态单协议全交互:

2. “实时+非实时”双模自适应:精准匹配AI生产节奏

针对大模型输出数据“快慢不均”的特性,AOQ 独创了双模式自适应机制

  • 实时模式 (Real-Time Mode):专为对时效性极度敏感的流式数据设计,比如摄像头与麦克风的实时采集。秉持“新鲜度和流畅性优先”理念,保障音画同步与交互的即时响应。
  • 非实时模式 (Non-Real-Time Mode):面向对数据完整性与顺序有严格要求,以及数据可以提前发送并缓存的场景。秉持“可靠性优先和超前发送”的理念,端侧进行超前缓存,从而降低全链路延迟,并保证极强的网络韧性。
  • 非实时模式超前可靠发送,断网依然续播:
  • 双模式无缝网络切换:

3. 极致抗弱网能力:升级QUIC内核,引入流级容错

AOQ集成了专为实时媒体交互的弱网对抗增强技术,显著提升高铁、地下车库等极端环境下的生存能力:

  • 0-RTT极速建连:增强QUIC的 0-RTT 特性,即使身处弱网环境仍可瞬间建立安全连接,保障AI助手即时响应。
  • 精准带宽估计与动态分配:内置改进智能带宽估计算法,敏锐感知网络瞬时波动,结合动态分配策略自动调节,确保核心交互不卡顿。
  • 流级冗余保护与快速重传:各模态独立建流,实现流维度隔离的前向冗余机制,结合快速重传能力,不牺牲延时即可消除弱网环境“滋滋”声或画面马赛克。
  • 极速建连响应:
  • 60%丢包仍能对话流畅:

4. 全球化部署:智能就近接入,保障跨地域一致体验

  • 全球接入智能分配:依托全球节点和智能调度策略,持续优化跨地域传输,无论身处何地,均能就近接入,获得稳定、低时延的一致对话体验。
  • 全链路质量监测:从接入到传输、全程可观测,依据丢包、抖动等关键指标快速发现链路异常,实现全球网络链路动态优化和快速定位。 image.png

四、Realtime API业务案例

  • Realtime API + fun-asr-realtime模型实现语音输入法:
  • Realtime API + qwen3.5-livetranslate-flash-realtime 实现实时翻译:
相关文章
|
2天前
|
人工智能 运维 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年7月,阿里云通义千问正式对外开放**Qwen3.8-Max-Preview旗舰预览模型**,作为目前千问系列规格最高、综合性能最强的新一代万亿级AI模型,该模型搭载2.4T超大参数架构,是阿里云首款突破万亿参数的原生多模态旗舰模型,全面覆盖文本、图像、视频、文档多维度处理能力。相较于前代热门Qwen3.7-Max版本,本次预览版实现全方位跨越式升级,在真实工程开发、多智能体长周期任务、全链路办公自动化、海量数据分析等高阶场景中,综合能力已达到全球顶尖模型水准。现阶段该模型已正式开放抢先体验通道,依托阿里云百炼Token Plan、Qoder编码平台、QoderWork办公终端三大专属
1746 0
|
6天前
|
人工智能 安全 测试技术
|
8天前
|
云安全 人工智能 安全
阿里云 Agentic SOC 位居 IDC MarketScape安全运营智能体2026领导者类别
以 Agentic AI 重构安全运营闭环,阿里云云安全在产品能力与市场份额
1200 3
|
3天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
464 18
|
2天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
399 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
|
8天前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
776 12
|
1天前
|
人工智能 测试技术 语音技术
Qwen-Audio-3.0-TTS 正式发布!AI 语音从 “能说话” 升级到 “会带情绪表达”
阿里云发布Qwen-Audio-3.0-TTS语音合成大模型,支持细粒度标签控制(如[gasp][angry])、freestyle自由风格、16种语言及20种方言,声学鲁棒性强。含Flash(首包延时300ms)和Plus(全球榜单冠军)双版本,已在百炼平台开放调用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
387 0
|
12天前
|
存储 人工智能 JSON
Qwen 本地部署搭配 ComfyUI 生成 AI 漫剧完整实操指南(小白零基础可落地,零成本无限生成+角色一致性天花板)
2026全网最优本地漫剧流水线:零成本、离线运行、角色统一、低配(8G显卡)可跑。融合Qwen本地大模型+ComfyUI双引擎,实现剧本生成→分镜绘图→动态成片全自动,隐私安全、无审核限流,新手30分钟上手,日更无忧。(239字)
|
7天前
|
数据采集 机器学习/深度学习 人工智能
田间杂草定位与检测4200张YOLO智慧农业数据集分享
本数据集含4200张真实农田图像,YOLO格式,单类别(杂草)高质量标注,覆盖多作物、多光照、多生长阶段等复杂场景,专为智慧农业杂草检测与智能除草设备研发设计,支持YOLOv5/v8/v10等主流模型训练。
382 94

热门文章

最新文章