蓝鲸观察
9月22日,2026云栖大会在杭州举行。围绕机器智能时代的到来,阿里巴巴集中发布并展示其在AI模型、AI芯片、AI云和企业级Agent应用等方面的最新进展。
阿里巴巴集团首席执行官吴泳铭在主旨演讲中表示,机器正在成为思考的主力,智能将成为可规模化供给的商品。他判断,未来机器产生的思考总量可能达到人类的1000倍以上,目前这一比例还不到人类思考总量的3%。
千问办公通过结构化整理和动态更新企业信息,为不同任务提供与业务相关的上下文。借助这些信息,Agent可以在明确的职责和权限范围内承担具体工作,逐步成为理解岗位职责、权限边界和业务目标的数字员工。
企业信息也大量产生于会议、客户拜访、面试、访谈和现场沟通,过去往往难以被完整记录并直接提供给Agent使用。
为补充这部分外部上下文,千问办公发布AI Agent硬件QwenNote,并推出首款产品QwenNote A2。该设备可转写和整理会议及线下沟通内容,并将其沉淀为千问办公能够调用的信息,供Agent进一步理解、处理并推进后续任务。
用户可以通过语音向QwenNote A2交代任务,也可以在听记结束后唤起千问办公。根据现场介绍,面试结束后,用户可要求Agent分析候选人的优缺点、评估岗位匹配度并将结果同步给HR;律师完成当事人会谈后,也可让Agent整理案情备忘、生成证据清单,并通过钉钉创建待办和预约会议。
大会公开资料显示,QwenNote A2重67克,配备6个麦克风,最远拾音距离为8米,连续转写时长为40小时,并可通过内置4G独立使用。
从企业上下文到QwenNote,千问办公一端连接企业已有的文档、系统和组织知识,另一端获取会议、拜访和现场沟通中的信息,再由Agent完成理解、整理和执行。
Wan 3.0推动视频生成向长时复杂多模态演进
在多模态生成领域,Wan 3.0是现场技术论坛的重点内容之一。论坛资料显示,视频生成正在从5秒左右的单镜头、单一动作或商品展示,向长时、多镜头和复杂叙事演进。
Wan 3.0采用原生多模态架构,可理解文本、图片、视频和音频等输入。阿里云官方技术文档显示,该模型可生成最长30秒的视频,支持多镜头、智能时长、参考音频等功能,输出分辨率覆盖480P、720P和1080P,也可读取参考文件和公开网页内容。
长时视频对人物、服装、场景、镜头运动和视觉风格的一致性提出了更高要求。现场演示展示了Wan 3.0在复杂运镜、跨镜头人物一致性、状态延续和风格稳定性方面的进展。论坛资料还显示,模型通过人类反馈强化学习进行偏好对齐,并围绕画面质量、运动表现、音频效果和镜头一致性等维度进行优化。
相关能力可应用于专业影视、互动短剧、广告、电商视频、游戏创作、音乐MV和创意设计等场景。现场展示的专业影视方向重点呈现工业质感、完整叙事和成片稳定性,并探索AI在脚本理解、镜头设计、角色保持、素材生产和连续叙事中的应用。
图片生成方面,现场论坛还介绍了Qwen-Image-2.1的更新方向,包括原生透明图像生成与编辑、多图和多层编辑等能力。图片、视频和音频能力的协同,可进一步支持广告设计、品牌内容、电商素材和互动内容生产。
芒测AI 3.0互动平台参展,探索心理测试与短视频融合
据项目方介绍,二期3层展区展示了基于阿里千问技术集成的视频生成平台芒测AI 3.0。
该平台定位为心理测试短视频Agent,尝试把心理测试中的情境设置、互动选择、内容生成和结果反馈转化为短视频体验。平台通过人物、情节和关键选择,将静态文字题目重组为互动内容,并根据用户的不同选择生成相应剧情或反馈。
免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。




京公网安备 11011402013531号