2026年6月,一家名为智象未来(HiDream.ai)的中国创业公司,在AI图像生成赛道做了一件让不少海外巨头坐不住的事。
其商用版图像生成模型HiDream-O1-Image-1.5,在全球知名独立AI模型评测平台Artificial Analysis的文生图榜单上斩获1265 ELO评分,登顶中国第一、全球第二,仅以1分之差屈居OpenAI之后,超越了Google Nano Banana 2、NVIDIA Cosmos3-Super-Text2Image和字节跳动Seedream 4.0等大厂的主流图像生成模型。令人意外的是,这并非偶然的技术爆发:就在半个月前,智象未来开源模型HiDream-O1-Image-Dev-2604刚刚拿下同一榜单开源模型的全球第一。半月之内“开源+商用”双线领跑,一家成立仅三年多的创业公司,凭什么把市值万亿的巨头甩在身后?
这不是算力堆出来的,是架构选择的结果。
一、告别“三件套”:UiT架构的底层重构
要理解HiDream.ai为什么能在榜单上超越谷歌和字节,得先看懂一个技术拐点:它放弃了当前主流文生图模型沿用至今的“文本编码器 + VAE + 扩散模型”模块化路径,选择了一条此前几乎没人敢走的全模态统一路线。
智象未来首席科学家梅涛在技术访谈中谈到一个细节:团队早期尝试图像生成业务时,用的也是市面上主流的开源模型。但很快他们发现一个非常棘手的问题——在这些模型里,文本有自己的tokenizer,图像和视频有各自的encoder / decoder,音频、动作、空间关系也往往沿着不同路径被处理,模块之间要反复转换信息。做一张简单的广告海报,只要画面里包含中英文混排的文字,模型就容易翻车。
这个问题在传统架构中几乎无解。因为每一次跨模块的信息传递,都会损耗细节、造成语义偏差——VAE负责压缩图像,T5/CLIP负责理解文本,DiT负责生成,三个模块各自为政,从输入到输出至少要经历三到四次跨模块转换,信息损耗是结构性的。
智象未来走了一条更颠覆的路:彻底砍掉独立的VAE和文本编码器,将图像像素、文本Token、视频体素、音频、动作及空间关系等原始信号,统一映射进同一个共享Token空间,由同一套Transformer(统一Transformer架构,UiT)完成理解、生成与推理。这不是在现有架构上“打个补丁”,而是从底层重新设计了信息处理的逻辑。把所有模态放在一起“青梅竹马”式长大,而不是成年后再强行相亲。
这套架构带来的直接好处是什么?一个足够有说服力的对比测试是,当生成一张高端白酒的奢华电商海报时,HiDream-O1-Image-1.5成功在羊脂玉瓷瓶的曲面上浮雕一整首八句中文古诗,文字内部还嵌入了金箔质感,同时处理了黑板岩、浅水池、焦散光影、盆景松树等复杂元素——没有一处文字变形,没有一笔错位。放在传统模块化模型里,这个任务可能会在三个环节各自出错:文本编码器可能根本读不全八句诗,VAE压缩时曲面上的文字扭曲,扩散模型的金箔材质处理得一团糟。UiT架构让所有信息在同一空间内直接协同,每个环节的损耗都被压缩到了最低。
更关键的是,UiT架构让模型以8B的小参数规模,跑出了不逊于其他厂商27B甚至更大参数模型的性能。这在AI行业普遍信奉“更大即更强”的今天,提供了一个完全不同的解题思路——架构创新可能比单纯堆算力、堆参数更具“弯道超车”的潜力。
这背后是团队对技术的长期深耕。智象未来成立于2023年3月,从底层多模态模型API服务起步,经历了从Diffusion UNet到扩散Transformer(DiT)的多次架构迁移,2025年从SaaS转向“结果即服务”(RaaS)商业模式,在商业化方向上进行了反复探索,才走到今天这一步。
二、从“抽卡”到“交付”:生产验证才是真本事
榜单拿到高分是一回事,能在真实的商业工作中稳定交付是另一回事。
HiDream-O1-Image-1.5选择在广告营销、电商视觉、影视分镜、IP创作等高要求的商业场景中展示能力,这意味着它不再是一个“画得很好看但没法直接用的灵感玩具”,而是能直接输出满足商业交付标准的成品。
这里有一个典型的对比:在多主体一致性控制上,传统模型往往难以保证同一角色的多角度视图之间维持五官、发型、服饰的稳定统一。而HiDream-O1-Image-1.5可以围绕同一角色生成多角度视图和多种情绪表情,保持高度一致性,显著提升角色三视图开发效率。在电商海报场景中,它能够将商品、场景、装饰元素与中英文营销文案自然融合,即使面对多层级卖点和复杂排版,文字可读性和画面完整度依然出色。
智东西团队对该模型进行过系统的三大场景实测,验证了其在文字渲染、画面真实感和商业完成度上的综合表现。在相对简单的竖版太空主题电影海报测试中,模型采用了三种不同字体,文字渲染准确,字体选择与画面主题契合;在要求更高的音乐节海报测试中,模型需要同时处理主标题、副标题、阵容列表、时间地点、票价和票务平台等多个信息层级,它成功生成了清晰的信息呈现和符合主题的中式水墨画风格;在最难的旧诗集页面生成测试中,要求完整生成英国诗人华兹沃斯诗歌的全部内容,并体现“旧诗集”的风格要求,模型几乎完美渲染了绝大部分内容,同时画面呈现出泛黄和岁月痕迹,仅有极个别单词出现小错误。这个循序渐进的测试路径印证了模型的真实能力边界。
另一组与Google Nano Banana 2的直接对比测试结果更值得注意。两者在同题竞技下,“中国白酒奢华电商海报”需要同时解决中文古诗渲染、复杂光影叠加、不同材质质感表达等多重任务,HiDream-O1-Image-1.5在中文文字的准确渲染、金箔材质的金属光泽以及水面焦散光效上都明显优于对手;“好奇小猫探索童话花园”场景中,其花朵的层次感和光影的柔和过渡也获得了用户更高偏好。
这种“生产验证”级的交付能力,源于架构层面的根本优势。UiT将文本Token与视觉像素从底层融合在一起,模型不再把文字当作后期“贴上去”的内容,而是从一开始就作为画面有机组成来理解与生成,这恰好切中了商业场景最核心的痛点之一——文字渲染与排版。更不用说多宫格和分镜设计能力,模型能够一次性生成多格连贯画面,并自动维持角色、场景、视觉风格的统一,对于需要快速产出脚本视觉稿的广告、短视频、动漫团队来说,意味着可以从“一张一张抽卡”升级为“一次出一套”。
三、“帧赞”:从单张图到影视工业化
单张图片的生成能力再强,也只是整个视觉创作链条中的一环。真正检验平台实力的,是全流程的整合能力。
智象未来在这方面的布局可以追溯到2024年之前的底层技术积累。2025年,公司正式从SaaS转向RaaS(结果即服务)商业模式,将重心从提供工具转移到交付商业结果。2026年4月,智象未来正式发布了一个可能更具产业意义的产品——全球首个专业级AI影视创作与协作智能体“帧赞”(aidrama.hidreamai.com)。
传统AI影视工具最大的问题是“拼盘式”组装,把不同的开源或闭源单模态模型通过API硬凑在一起,导致角色发型、光影在每一帧都会发生难以预料的形变。本质上这不是AI不行,而是底层没有协同。“帧赞”依托智象未来自研的原生多模态大模型,从底层架构开始深度适配影视创作全链路需求,实现文本、图像、音频、视频在系统内部的无缝打通。当创作者在平台上创建项目后,角色设定和美术风格就被锁定在底层,精准匹配从分镜绘制到音视频制作的全环节。
在产品能力层面,“帧赞”覆盖了从剧本到成片的完整影视制作链条:剧本智能解析自动拆解核心场景、角色和镜头需求;AI辅助分镜创作快速输出专业分镜内容;基于分镜的批量画面生成与视频制作;以及AI智能后期粗剪、音效配乐——无需多环节人工干预和跨工具跳转操作。这套流程的效率提升非常具体:过去一个七八人的美术团队需要苦熬一周才能完成的镜头绘制任务,如今只需一人半天即可达成。在需要大量产能的短剧和漫剧赛道,这意味着原本需要数十人数月才能完成的精品内容,可以压缩到一人一天完成5分钟高品质成片的水平。
此外,“帧赞”对“抽卡”问题的解决也很直接。市面上的AI工具大多只能覆盖单一场景的碎片化生成,普遍存在“盲盒式”生成、画面不可控等硬伤。“帧赞”从镜头运镜、画面景别到光影层次、材质质感,每一个画面细节都可标准化、精细化调控,平台生成画面的细节精度、动态流畅度和光影真实度均达到影视工业标准,且无需排队即可高效生产内容。创作者可以直接基于分镜表内容在无限画布内精准生成对应视觉画面,实现导演的镜头意图,真正做到“分镜即成片”。
从单张电商海报到完整的分镜设计和IP多视角生成,再到全流程的影视创作协作,HiDream.ai的商业化路径并非单纯比拼参数,而是在底层找到了一条更优的技术路线,然后在生态层面逐步构建从生成工具到行业协作平台的完整版图。智象未来的长期目标是构建原生全模态世界模型——既然一张图像已经承载了现实世界中主体、空间、材质、光影和关系,那么只有稳定理解并生成这些状态,模型才能进一步处理连续时间中的运动、因果和叙事。
四、开源生态与商业变现的良性循环
如果说“帧赞”展示了智象未来在专业化商业生态上的野心,那么HiDream.ai的另一条腿——开源策略——则在开发者社区层面加速筑起了护城河。
8B参数的开源模型HiDream-O1-Image登顶Artificial Analysis开源榜单全球第一,以较小的参数规模压制了市面上27B的同类产品。相比拼参数和算力的传统路径,智象未来找了一条更聪明的路:用架构创新降低对规模的依赖,再通过开源快速聚拢开发者生态。
这种“开源引流、商用变现”的循环对智象未来很重要。开源吸引了大量AI爱好者、独立开发者和创业团队,他们在GitHub和Hugging Face上部署试用,免费为平台贡献了生态流量和技术反馈;商用版本则面向广告营销、电商视觉、影视分镜等真实商业场景完成价值交付,实现可持续盈利。更重要的是,整个商业模式完全围绕国内合规环境设计,中文语境、数据安全、本地化适配等方面不存在海外工具的潜在政策风险,对寻求AI国产化替代方案的企业用户来说,这是一个绕不开的考量因素。
在国际市场方面,智象未来也布局了英文国际版产品VIVA(vivago.ai),并在体验平台HiHarness.ai上线了最新模型的在线体验入口,为海外开发者提供了与国内同步的技术接触渠道,这也与海外版Dreamily等其他出海AIGC产品的策略方向相似。
不过,在更广泛的AI工具应用场景中,这种先免费后付费的商业模式也并非没有隐忧。即梦AI等竞品平台被多位用户投诉存在“付费后积分不到账”“生成视频排队排一天”等运营问题。智象未来若要持续推进从技术验证到商业交付的转型,在用户权益保障和服务响应效率方面,仍有需要细心打磨的地方。
五、最后聊几句
榜单从来不是终点,但榜单背后反映的技术路径选择值得深究。
HiDream.ai的迅速崛起,证明了在AI赛道中不只有“参数越大越厉害”这一条路可走。UiT架构的创新思路——将所有模态信息拉平到同一个空间里统一处理——不仅解决了传统模型在文字渲染、多主体一致性、连续分镜等场景下的长期痛点,还为整个视觉生成领域提供了一种新的思考方向。
从“会写字、懂排版、能分镜”到通过“帧赞”打通影视创作全链路,HiDream.ai正在从单点能力输出向全流程工业化赋能迈进。对于正在寻找AI驱动创意内容生产解决方案的团队和创作者来说,这个平台的演化方向可能比一次榜单登顶更具长期价值。
适合哪些场景?如何接入?
如果你是独立的AI绘画爱好者、自媒体内容创作者,或是需要快速产出设计素材的小型团队,HiDream.ai官网提供了零门槛的免费体验入口,当前免费版支持文生图基础功能,无生成数量限制但模型和速度有一定限制,图像编辑功能需付费使用。如果你是需要批量生成内容的商业用户,可以通过“千象API”接口获得更高级的自动化生成能力;如果你来自影视制作、广告营销或动漫游戏等专业行业,需要从剧本到分镜再到成片的全流程AI辅助协作,“帧赞”平台或许是最契合你需求的工具。
当前HiDream.ai在国内的AI图像生成工具中占据独特的技术位置,对中文提示词的理解和处理能力相对自然,适合公众号、小红书等自媒体用户的配图需求。对于追求成本效益、希望尝试国产替代方案的AI爱好者或创业团队,它提供了一个值得关注的差异化选择。
