AI工具Score B (59)

Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差

2 小时前2 viewsSource: 36Kr 出海
月之暗面于7月发布Kimi K3,这款总参数2.8万亿、支持100万token上下文的MoE模型,凭借原生多模态能力在Coding和长程Agent任务中表现突出,曾以1679分登顶Arena Frontend Code榜单。所谓原生多模态,指图像与文本从预训练阶段就共同塑造主模型,使视觉成为模型检查工作、发现错误和调整行动的反馈机制。K3在测试中能精准识别网页视觉偏差,通过"vision in the loop"方式在代码与截图间反复迭代优化。与此同时,阿里Qwen3.8-Max和字节Doubao-Seed-2.1也沿此路线将视觉作为基础能力,而DeepSeek、智谱和腾讯混元的最新基座仍以文本输入为主。业内对多模态价值无分歧,关键在于时机与代价:视觉输入能提升开发者与普通用户的使用体验,但外接视觉工具与原生多模态在通信通道宽度和后训练效率上存在本质差异。原生多模态模型可直接读取生成页面进行视觉强化学习,而模块化方案需在模型间传递感知结果。不过,加入多模态可能削弱语言、推理和Coding能力,任务越多越难平衡,基模团队需在资源分配上做出抉择。
#DeepSeek