星辰通用人工智能实验室(Xingchen AGI Lab)是中国电信星辰基础大模型的研发单位,将“基于国产芯片训练国际一流模型”作为自己的使命目标,开展战略性、引领性、系统性的通用人工智能全栈技术研发,推动国产生态成为通用人工智能原始创新和规模应用的重要力量。实验室于2026年3月在北京成立,历经前身近五年建设,团队成员超270人,平均年龄31岁,技术方向牵头人及骨干均毕业于清华、中科院、斯坦福、哥伦比亚等国内外知名高校,核心基模研发团队90%来自阿里、腾讯、百度等互联网大厂。当前,实验室基于中国电信国产万卡集群,已完成视觉、语音、语义和多模态四大方向布局,模型参数覆盖十亿/百亿/千亿/万亿,在GitHub、huggingface等主流开源社区下载次数突破60万,入选2025年“央企十大国之重器”。
你有没有发现,现在的 AI 看图识物、回答问题已经很熟练,但一碰到 “哪个物体离镜头更近”、“杯子在书本的哪一侧” 这类空间问题,就很容易出错?
这背后的核心瓶颈,在于主流多模态大模型的三维空间感知能力:模型可以精准识别二维图像中的物体语义,却难以稳定还原真实场景下的深度、方位等三维空间关系。过去行业的主流做法,是把坐标、距离这些几何信息转成文字,再让大模型靠语言逻辑去推理。但是几何信息一旦转译为文本,大量精细细节就会丢失,推理结果通常很难精准。
针对这一行业痛点,星辰通用人工智能实验室(XingChen AGI Lab)联合上海交通大学给出了新解法—GeoAnchor 分解式潜变量框架。它通过位置、方向、几何三类潜变量完整保留连续几何信息,再搭配文本与潜变量交错推理的模式,让 AI 不用再靠 “转译文字” 脑补空间,而是直接基于原生几何线索还原三维结构。
目前这项研究已被多媒体领域顶会 ACM Multimedia 2026 正式接收。在三项国际公认的空间推理权威评测中,XingChen AGI GeoAnchor 方案仅以 2B 的轻量参数规模,三项基准平均分均优于 9B 的 Qwen3.5 与 38B 的 InternVL-3.5,展现出“小参数、高性能”的突出优势。无论是空间判断的准确度,还是面对不同场景的适配能力,GeoAnchor 均处于行业第一梯队。

目前行业内提升多模态模型空间理解能力,主要沿两条技术路径探索:一是通过大规模空间数据训练,或引入深度图、点云等几何信息增强感知;二是借助潜变量推理,试图突破纯文本描述的局限。但两条路径均存在尚未突破的核心瓶颈。
针对这一行业共性难题,GeoAnchor 提出分解式潜变量表示方案,对不同类型空间信息进行解耦建模,它把空间信息拆解为位置、方向、全局几何三类独立线索,分别负责局部物体分析与全局场景把控,每一步推理都有明确可追溯的依据,最终对空间关系的判断也更精准、更可靠,从底层重构了空间推理的信息传递逻辑。
图1直观对比了三种 AI 空间推理的思路:最左边靠文字转译判断空间关系,容易丢失精细几何细节;中间用单一潜变量承载信息,却理不清推理依据;最右侧 GeoAnchor 的分解式推理,把位置、方向、全局几何信息拆解开分别处理,每一步判断都有迹可循,空间推理也更精准。

不同的空间任务,看重的信息也不一样:定位物体要看位置线索,判断朝向要看物体之间的相互关系,理解复杂场景则需要把握整体几何结构。但传统方案只用单一潜变量打包全部空间信息,各类语义互相混杂,模型自己都分不清该依靠哪条线索做判断。
GeoAnchor将空间信息拆解为位置、方向与全局几何三类潜变量,前两者构建可追踪的局部空间锚点,后者编码整体场景结构,各司其职、协同配合。搭配文本—潜变量交错推理机制,几何证据可直接参与推理链路,推动模型从依赖文字描述空间,升级为基于原生几何线索精准理解三维空间。
和普通文本 token 不一样,GeoAnchor 的空间潜变量是连续隐状态,专门存储文字很难描述的几何信息。推理时不再直接输出文本答案,而是形成“规划‑取证‑推理”的交错模式:文本梳理要解决什么问题,空间潜变量输出几何证据,两者协同完成空间判断。同时配套潜变量映射机制,让空间特征和模型内部表征对齐,防止推理过程出现信息偏差。简单理解:文本负责明确要找什么,潜变量负责保存文字说不清楚的空间证据。
不同空间任务首先依赖精确的局部信息。为此,GeoAnchor将局部空间拆分为位置潜变量和方向潜变量:位置潜变量描述目标在三维空间中的位置,方向潜变量刻画物体之间的相对方向关系。
通过三维坐标和方向监督,模型能够学习具有明确物理含义的空间表示。相比难以解释的隐藏状态,位置和方向潜变量能够被直接分析,帮助验证模型是否关注正确目标、理解正确空间关系,成为连接视觉信息与空间推理的可追踪空间锚点。
只靠局部的位置、方向,模型依旧很难吃透复杂场景的整体逻辑。为此我们引入了全局几何潜变量,对整个场景的空间结构做编码,捕捉深度、物体表面以及整体场景布局。
完整三维场景细节海量,但潜变量的容量有限。GeoAnchor 采用软覆盖对齐策略:不强行让单个潜变量承载全部几何信息,让不同表征各自关注互补的空间特征,合力覆盖关键线索。 该策略使模型兼顾整体场景理解与空间表示效率,综合平均性能达到 61.7%,优于多种传统特征压缩方式。

如何避免精心设计的潜变量沦为缺乏实际作用的“占位符”?GeoAnchor采用四阶段协同训练方案,让潜变量从“具备空间语义”逐步发展为“真正参与推理”。
GeoAnchor基于 ScanNet 三维场景数据训练模型预测物体位置与相对方向,先建立稳定的局部空间锚点,筑牢空间推理的底层基础。
在具备局部感知能力后,GeoAnchor进一步联合训练位置、方向和几何潜变量,推动模型从单物体关系判断,拓展至全局场景结构理解。通过空间推理任务训练,模型学习处理空间关系、距离判断、深度理解和视角转换等问题,逐渐掌握根据任务需求结合局部线索与全局几何信息。
显式几何监督能够赋予潜变量明确的空间含义,但过强约束也可能限制其与语言推理的结合。因此,这一阶段GeoAnchor移除几何监督、仅保留答案监督,让潜变量在保留空间知识的同时,更好地适配真实推理流程。
不同问题需要的信息并不相同。简单任务依赖局部空间线索,复杂场景则需要结合全局几何信息。为此,GeoAnchor引入了强化学习机制,让模型自主选择合适的推理模式,避免不必要的信息调用,实现从固定推理流程到自适应空间推理的转变。

在SPAR-Bench、SPBench、ViewSpatial三项国际权威空间推理基准评测中,仅2B参数量的GeoAnchor分别拿下68.4、69.7、47.0的平均分,全部位列榜单第一。全面超越GPT-4o、Gemini-2.5-Flash等头部闭源大模型,以及多款开源通用多模态模型与专用空间推理模型。GeoAnchor在域内与域外场景下均展现出领先的空间推理能力与泛化表现。

消融实验验证了分解式潜变量设计的核心价值:仅采用常规微调或文本思维链训练,模型平均成绩分别为51.8%和51.7%,性能提升十分有限;引入单一潜变量后,平均成绩小幅提升至53.6%,增益仍不突出。而当局部与全局潜变量协同工作时,平均成绩达到60.9%,实现了显著的性能跃升。这也证明,空间推理能力的突破关键,不在于简单增加潜变量,而在于为不同潜变量划分明确的空间理解职责。

四个训练阶段相辅相成、缺一不可。消融实验结果显示,移除任意一个训练阶段,模型的空间推理性能都会出现不同程度的下滑。其中潜变量松弛阶段的影响最为显著,是打通空间表征与语言推理、让几何线索真正服务于推理的核心环节。 在此基础上,GeoAnchor进一步加入自适应模式奖励,模型性能再获提升,三项基准综合平均分达到61.7%,也印证了自适应推理路径选择的额外增益。

注意力可视化结果表明,GeoAnchor能够准确聚焦与问题相关的目标区域,不同位置潜变量呈现出清晰分离的注意力模式,验证了分解式潜变量对空间信息的有效建模能力。

当下,多模态大模型正加速向视频理解、机器人、具身智能等真实场景落地,跨时序、动态化的空间感知能力愈发关键。以长视频理解为例,模型的能力边界早已不止于单帧内容识别,更需要跨越时间维度持续追踪物体空间关系、感知场景结构的动态演化。GeoAnchor 所探索的通用空间推理范式,让连续、可解释、可组合的空间信息深度参与推理全流程,可平滑拓展至视频理解场景,将 3D 空间关系建模融入连续帧分析,推动视频理解从 “看见画面” 真正迈向 “理解动态三维世界”。
目前,这套空间推理技术已在中国电信多个业务领域实现规模化落地,依托中国电信在视频与视觉智能领域的深厚应用积淀,为多个行业场景注入空间智能能力。
在天翼智看 / 智巡业务中,空间感知与推理能力深度赋能安防巡检、园区值守、区域监控等场景,能够精准捕捉画面中物体的位置关系、运动轨迹与空间异常特征,有效提升异常事件的识别准确率,降低误报漏报率,大幅提升了无人值守场景的智能管控效率与运维水平。
在扬州交管项目中,针对城市交通精细化治理需求,模型可对路口车辆、行人的空间交互关系进行精细化建模,支撑车流轨迹分析、违停空间判定、交通事故场景空间还原等核心能力,助力交通管理从传统的 “画面内容识别” 升级为 “全域空间态势感知”。
未来,GeoAnchor 所代表的空间推理技术还将持续向更多行业渗透,为城市治理、工业生产、家居智能等千行百业的数字化、智能化升级提供底层空间认知能力支撑,推动空间智能从技术创新真正走向产业实践深处。
论文链接:https://arxiv.org/pdf/2607.13454
代码链接:https://github.com/JerryPW/GeoAnchor
