京东全球首发全栈开源视频交互大模型JoyAI

IT时代网6月22日消息,京东开源实时视频视觉语言交互模型JoyAI-VL-Interaction,这也是全球首个全栈开源的interaction模型和系统,并获得vLLM-Omni的day-0原生支持。该模型让大模型从"一问一答"走向"边看边说",开发者可基于此快速搭建能持续观察、自主判断、即时响应的实景AI助手。

JoyAI-VL-Interaction实现了三重突破:一是主动判断而非被动回答——模型可持续观察视频流,自主判断何时该说话、何时该沉默,如用户设置"裁判出示红牌时提醒我",模型会持续值守并在事件发生时自动预警;二是实时响应而非事后总结——面向正在发生的视频流,画面变化时即可响应,适用于安防预警、实时翻译、直播解说等场景;三是适时智能体委托——遇到复杂任务可交给后台大模型或Agent,前台继续观察现场,后台处理完毕后自然接回对话,形成"前台实时助手+后台智能大脑"的协作系统。

在58个真人盲评案例中,JoyAI-VL-Interaction对比豆包视频通话助手总体胜率77.6%,对比Gemini视频通话助手总体胜率87.9%,监控预警场景对两个基线均取得100%胜率。此次开源涵盖模型权重、交互数据集、训练方案和完整可部署系统,支持摄像头、直播流、监控流等多种视频输入,ASR、TTS、可视化界面、后台模型均可按需替换,可改造为安防监控、老人看护、直播讲解、AI眼镜、无障碍辅助等实时AI助手。

京东JoyAI-VL-Interaction

图片为AI生成的示意图

创作声明:本文借助AI辅助创作

THE END