在CCF Chip 2026的无锡太湖论坛上,中科通量展示了基于开源免授权费的 RISC V 处理器架构的12核视频AI芯片,用"数据到位即运算"(数据驱动而非靠下一条指令驱动)的数据流思路挑战通用GPU,但现场Q&A抛出的编译器与生态质疑,决定了它只能以开放问题登场。
想象一颗没有程序计数器的芯片。普通处理器里,程序计数器是心脏,它一步一步把指令从内存里取出来,让CPU按顺序执行。但金刚GC3的设计者把这一步直接拿掉了:计算不再由"下一步该跑哪条指令"驱动,而是当某个运算节点的输入数据全部到位,节点就立刻开始工作。这就是所谓的"数据流架构":数据到位即运算,指令流退场。
CCF Chip 2026 在无锡太湖边举办的"数据流计算论坛"上,这场本属于计算机体系结构课的讨论,第一次被摆到了产业发布会的中央。论坛由中国科学院计算技术研究所研究员叶笑春主持,背景是一个被多次点名的判断:随着摩尔定律放缓,中国算力路线正在从"靠制程缩小追赶通用芯片龙头",转向"在细分场景里建护城河"。视频AI被视为最值得挖的深井之一:目前相当比例的AI算力消耗在视频上,而视频处理的天然并行性正好契合数据流模型的胃口。
金刚GC3(中科通量,官方名SmarCo HT Tech)是这场讨论里最具体的一笔赌注。它采用开源、免授权费的RISC-V架构,12核,主频2.0GHz,公司公布的指标为:INT8算力200 TOPS,FP16算力32 TFLOPS,硬件解码支持128路1080P@30fps、硬件编码64路。这些都是中科通量首席工程师罗鑫在大会现场给出的数字,目前没有独立基准测试对照。
但架构问题才是这场发布真正要回答的。传统GPU里,程序计数器决定计算节奏;数据流芯片里,数据本身的到达决定计算节奏。当输入是一路1080P视频流时,控制器一直在等"下一条指令",而数据流节点已经在处理刚到的那一帧。理论上,这能砍掉指令存取与调度开销,把更多晶体管预算留给算力本身。上海交通大学教授冷静文在论坛上说:"在视频AI推理上,它能对标主流GPU的峰值算力,真正的差异化杀手锏是同功耗下的视频处理密度。"这是目前两个在公开记录中为这款芯片背书的学术声音之一。
但现场Q&A也抛出了反向压力。中科通量把目标场景定得很窄:AIGC视频生成、智慧城市分析、工业视觉感知,明确不做通用AI负载。这把"编译器成熟度"和"软件生态"两座大山直接顶到了聚光灯下:数据流架构的并行性优势依赖于工具链能把通用代码自动转成"数据驱动"的执行图,而这条工具链在过去十年并不比CUDA生态宽。现场有听众直接问:当模型从CNN换到Transformer再换到下一代架构时,这套流水线是否还跟得上?
还有一个更冷的问题:规模化。当客户从1路摄像头扩到1000路、从单台服务器扩到整城市级部署时,内存带宽、片上互连、故障容错都会从"实验室规格"变成"工程难题"。GC3目前公开的演示集中在这头,没有触及后者的真实负载。
中科通量不是从零开始。这家公司此前在信创(国产化IT)兼容性认证上有RISC-V与其他指令集的积累,意味着它有产品化通道,不只是论文。但"已有渠道"与"在视频AI这一具体场景里赢得主流客户"是两件不同的事。
那么,金刚GC3要成立需要什么?三件事可以盯:是否有独立第三方在视频AI主流模型(如主流视觉Transformer或视频生成模型)上跑出对照数据;编译器与软件栈是否在一年内出现可被外部开发者复现的工具链;以及中科通量能否公开至少一个千路级或城市级的真实部署案例。在那之前,把这场发布会读作"中国算力路线在细分场景上的一次公开押注"比读作"重新定义视频AI算力规则"更准确。