两年前,田柯宇因干扰模型训练被字节跳动解聘并被起诉索赔800万元。如今,他创办的公司还没有正式产品,就已拿到近3000万美元融资,估值达到2亿美元。据彭博社10月7日报道,投资方包括五源资本、IDG资本、钟鼎资本等,前两家机构向该媒体确认参与投资,未透露更多细节。这家公司尚未公开名称,团队约10人,其中几名成员来自字节跳动。

字节前实习生田柯宇创办公司获近3000万美元融资,瞄准世界模型方向

团队瞄准的是李飞飞也在押注的世界模型方向:让AI学习物体如何运动、环境如何随行动变化,可应用于机器人、自动驾驶和交互式视频。田柯宇准备从自己擅长的图像生成研究入手。据他介绍,团队已构建一套约20万个符号的“视觉词典”,用于帮助AI处理视频信息。与一张静止的图片相比,视频还要处理连续画面之间的变化:物体在移动,视角在改变,前后帧的内容需要彼此衔接。

他与字节跳动的纠纷始于2024年夏天。按字节内部通报的说法,当年6月至7月,他因对团队资源分配不满,编写、篡改代码干扰研究项目的模型训练,8月被辞退,相关情况被告知其就读学校和行业联盟。对网传“涉及8000多张GPU、损失上千万美元”等说法,字节澄清称,受影响的是商业化技术团队某研究项目的模型训练,不涉及大模型等其他业务,也未影响正式项目和线上业务,网传规模严重夸大。同年11月,字节提起诉讼,要求赔偿800万元并公开道歉;据彭博社查阅的判决书,法院判令田柯宇因违约赔偿50万元。他向彭博社解释,自己关闭了另一名实习生的程序,想把计算资源让给其他研究人员,承认做法不当,并称若能重来会选更明智的做法。字节发言人未回应彭博社的置评请求。

同在2024年,他作为第一作者发表的《Visual Autoregressive Modeling》获得NeurIPS 2024最佳论文奖。该研究提出一种更高效的图像生成方法:先得到低分辨率的图像表示,再逐级生成更高分辨率的结果,同一尺度内可以并行生成,不必逐个等待。论文在ImageNet的256×256图像生成测试中报告,推理速度约为所选自回归基线的20倍,图像质量也有所提升,研究还展示了图像补全、扩图和编辑等能力。论文由5位作者合作完成,署名机构包括北京大学和字节跳动,模型与代码已公开。NeurIPS在评奖说明中强调,委员会依据论文的科学价值独立作出决定。