• 2027年第38卷第5期文章目次
    全 选
    显示方式: |
    • 低轨卫星具身自主体的多模态世界状态推理方法

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007752

      摘要 (138) HTML (0) PDF 1.83 M (109) 评论 (0) 收藏

      摘要:针对低轨卫星连续任务中多模态状态分散、硬约束耦合和异常后全局重规划代价高等问题,本文提出一种基于多模态世界状态的任务规划与异常恢复方法。方法首先将可见光/遥感图像、星上遥测序列、轨道环境上下文与任务语义对齐到统一决策时刻,构建带可用性掩码的统一世界状态层;随后在任务—资源—环境—动作动态图上进行硬约束传播,并结合状态转移模型评估未来可达性;再通过预测—观测残差定位异常及其影响路径,仅在受影响时间窗口内执行局部恢复控制。训练阶段使用满足相同硬约束的MILP离线求解器生成教师轨迹,先进行行为克隆预训练,再在数字孪生环境中闭环交互并进行优势加权更新。在自建低轨卫星数字孪生基准上的实验表明,所提方法在任务成功率、异常恢复成功率和约束满足率上分别达到89.8%、81.6%和96.3%,较最强基线分别提升6.7、12.2和3.3个百分点,同时保持59 ms的在线决策时延。结果说明,上述四项机制能够在数字孪生连续任务场景中改善规划可执行性与局部恢复质量。

    • 面向机器人操作的技能级数据增广方法

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007753

      摘要 (117) HTML (0) PDF 1.17 M (96) 评论 (0) 收藏

      摘要:面向视觉驱动运动策略的模仿学习在机器人操作中展现出良好前景,但其性能通常依赖大量代价高昂的人工示教数据。仿真环境中的合成数据生成能够在一定程度上缓解真实示教不足的问题,但该方式往往需要复杂的仿真器构建、数字资产制作和参数调试,且在真实场景部署时仍受仿真到现实迁移差异的限制。因此,机器人操作领域亟需一种轻量化、即插即用的数据增广框架。针对上述问题,本文提出一种面向真实机器人示教的数据增广框架。该框架以三维点云为主要表示,通过轻量化场景编辑对已有示教进行重组和扩展。已有研究表明,运动规划级增广能够通过轨迹变换和路径重规划提升策略对物体空间布局变化的泛化能力;与之不同,本文进一步关注完成技能阶段的数据增广,以提升策略在接触操作和物体交互过程中的稳定性与泛化能力。在每个任务仅需一条人工示教的条件下,本文设计了两种技能级增广机制:失败恢复将被扰动的执行轨迹转化为纠错训练信号,使策略学习从执行偏差中恢复;接触保持扰动在保持接触区域几何不变的前提下,仅对物体非接触区域施加结构化形变,以引导策略关注任务相关的局部接触特征。在多类真实机器人操作任务上的实验结果表明,所提方法能够显著提升任务成功率,并在分布外物体和分布外失败恢复场景中表现出更强的泛化能力,验证了完成技能阶段数据增广的有效性。

    • 面向场景文字理解的通用多模态大模型OCR提示检索增强方法

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007754

      摘要 (188) HTML (0) PDF 2.90 M (125) 评论 (0) 收藏

      摘要:场景文字理解是真实世界视觉语言任务的核心能力,在视觉问答、图像描述等场景中具有重要应用价值.随着多模态大模型的快速发展,人工智能在场景文字理解领域取得了突破性的进展.然而,通用多模态大模型在该场景中依然普遍存在OCR信息利用不足、OCR识别错误和跨模态理解语义偏差等常见问题.因此,本文提出一种面向场景文字理解的通用多模态大模型OCR提示检索增强方法(OCR Prompting Retrieval-Augmented,OP-RA).该方法首先利用OCR系统提取图像中的文本信息,并分别从视觉模态与文本模态对OCR Token进行特征建模,关联跨模态的OCR视觉语言特征.在此基础上,结合任务语义信息,通过相似度计算实现任务感知的OCR检索增强,从候选中筛选出最相关的Top-K个关键OCR文本,并以结构化Prompt的形式输入大模型,继而提升模型的推理与理解能力.该方法无需额外训练,具备良好的即插即用特性.在TextCaps与TextVQA两个典型场景文字理解任务上的实验结果表明,所提出方法在BLIP-2,LION及InfiniteVL等多种大模型上均取得稳定性能提升,验证了其有效性与良好的泛化能力.

    • 基于复杂性评估的分流式人体动作生成

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007755

      摘要 (130) HTML (0) PDF 1.07 M (105) 评论 (0) 收藏

      摘要:具身智能的发展要求智能体能够根据语言指令生成自然、连贯且符合身体结构约束的动作行为,文本驱动人体动作生成因此成为连接语言理解与身体行为表达的重要任务。现有基于扩散模型的人体动作生成方法在动作自然性和文本语义一致性方面取得了显著进展,但通常在训练和推理阶段对不同复杂性样本采用统一处理方式,难以充分适应样本复杂性差异。针对上述问题,本文提出一种基于复杂性评估的分流式人体动作生成方法CARM。该方法首先通过骨盆特征与文本特征之间的运动方向匹配度,以及四肢特征与文本特征之间的运动姿态匹配度,计算样本复杂性评分,并据此获得不同复杂性样本的分流标记;在训练阶段,根据样本复杂性评分为不同样本分配差异化的时间步采样范围,实现时间步采样分流;在推理阶段,根据复杂性评分选择浅层、中层或深层输出路径,使复杂性评分较低的样本提前输出,而复杂性评分在当前阶段仍然偏高的样本继续进入更深层路径生成。进一步地,本文引入浅层和中层辅助出口损失,以提升多出口推理的稳定性。实验结果表明,本文方法在HumanML3D和KIT-ML数据集上提升了动作生成质量,验证了所提方法的有效性。

    • 面向恶劣天气的网络感知型车路协同自主决策系统*

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007756

      摘要 (150) HTML (0) PDF 1.63 M (92) 评论 (0) 收藏

      摘要:智能网联汽车作为具身智能的重要应用形态,通过车辆与外部信息的协同感知,弥补单车感知在低能见度、探测距离缩短条件下的不足,但外部协同信息在实际传输过程中还会受到时延、丢包等影响,难以直接稳定支撑当前决策.现有研究大多分别围绕感知增强、去噪或通信补偿分别展开,缺乏对物理环境、网络链路与协同行为之间关系的统一建模,这导致决策难以在多维扰动下实现协同与通信的动态平衡,甚至可能因错误引导引发安全风险.尤其在雨雪等恶劣天气条件下,低能见度、感知退化以及通信信号波动会进一步加剧上述问题.因此本文提出一种面向雨雪等恶劣天气的网络感知型车路协同自主决策系统.该系统综合链路时延、丢包率、信息新鲜度等因素,对外部协同消息进行有效性约束与可信度评估,并围绕当前决策时刻构建统一时间窗口,实现多模态异步信息的时空对齐.并进一步构建空间、车辆和信息三层耦合模型,将环境约束、车辆交互关系和信息传播质量共同纳入联合决策过程,从而实现对外部协同信息利用权重的动态调节,提升系统在强降雨雪时视线受阻、路面湿滑制动距离受限等情况下应对突发事件预警等场景下的决策安全性、准确性与鲁棒性.

    • 基于分块自回归与局部扩散的语音驱动动作生成

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007757

      摘要 (123) HTML (0) PDF 1.16 M (89) 评论 (0) 收藏

      摘要:生成与语音同步且自然连贯的身体动作是提升数字人交互表现力的重要基础.该任务要求模型既能建模长时序动作演化,又能恢复局部动作细节.针对纯自回归模型易出现长程误差累积、纯扩散模型在长序列生成中采样开销较大的问题,本文提出一种分块自回归与局部双向扩散相结合的混合生成框架.该方法先将动作潜在序列划分为固定长度分块,并由聚合编码器提取块级表示;再利用块级因果Transformer建模跨块长时依赖,输出分块摘要向量;最后通过结合历史上下文的局部双向扩散解码器在块内恢复动作细节.进一步地,本文引入基于自回归条件摘要的无分类器引导和基于温度控制的常微分方程采样机制,以增强语音条件约束并提高采样可控性.在BEAT2数据集上的实验结果表明,本文方法取得了4.925的FGD、7.932的BC和13.24的Diversity.相较于EMAGE,本文方法将FGD由5.512降至4.925,BC由7.724提升至7.932,表现出更优的动作质量与语音同步性.

    • 基于世界模型自校准的智能体终身学习方法

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007758

      摘要 (161) HTML (0) PDF 2.09 M (121) 评论 (0) 收藏

      摘要:在大规模多模态模型驱动的移动智能体研究中,构建内在世界模型以实现图形用户界面(GUI)环境下长程推理与规划能力的重要基础.然而,开放环境的动态非确定性常导致智能体产生状态转移幻觉,即内在预测预期与环境真实反馈失配,进而引发规划失效与错误级联.现有的自我反思机制多受限于模型自身的认知盲区,且缺乏在长周期交互中自主演进的能力.鉴于此,本文提出一种基于System-1和System-2解耦的智能体双层认知系统结构.System-1作为直觉执行层,利用参数化世界模型进行快速状态推演与决策树规划;System-2作为监督认知层,通过实时校验状态转移一致性扮演智能体的认知监管层.当检测到动力学残差超过阈值时,System-2介入并利用反事实因果归因机制定位失效根因,引导智能体执行状态回溯与动态重规划.此外,该架构通过构建情景因果记忆库形成了闭环数据飞轮,驱动世界模型参数在交互中持续自校准.在本文构建的多领域跨应用GUI任务基准及跨域迁移设置下,实验结果表明该架构能够降低错误级联并促进部分因果知识内化.随着交互规模的扩大,系统干预频率下降而任务独立成功率提升,显示出在所测试GUI任务范围内进行持续自校准的阶段性效果.源码清单见链接:https://github.com/LuRu520/rs025_materials.git

    • 基于世界模型因果推断的图像压缩方法

      2027, 38(5). DOI: 10.13328/j.cnki.jos.007759

      摘要 (136) HTML (0) PDF 3.10 M (151) 评论 (0) 收藏

      摘要:图像压缩的目标是在有限码率约束下尽可能保留图像信息.现有方法或将图像视为像素的组合进行率失真优化,或借助生成模型先验合成感知质量良好的图像,但均未对图像内部因果关联结构进行显式建模,导致图像内部丰富的因果信息未能被有效利用.本文提出一种基于世界模型因果推断的图像压缩方法,将自然图像建模为具有严密因果结构约束的世界场景切片,将承载场景因果关联结构的关键区域定义为因果锚点,即场景的世界基元,并从信息论视角分析将码率优先分配给因果锚点的理论最优性,证明世界模型的预测能力越强,向因果锚点倾斜分配码率所带来的压缩增益越显著.基于此,本文设计了以世界模型为推理引擎的编解码框架:编码端通过链式推理定位因果锚点,构建非均匀码率分配策略;解码端以因果锚点为起点,借助世界模型的因果推理能力完成高质量场景重建.实验结果表明,本方法在极低码率区间的各项指标上显著优于现有方法.

当期目录


年第期

文章目录

过刊浏览

年份

刊期

联系方式
  • 《软件学报 》
  • 主办单位:中国科学院软件研究所
                     中国计算机学会
  • 邮编:100190
  • 电话:010-62562563
  • 电子邮箱:jos@iscas.ac.cn
  • 网址:https://www.jos.org.cn
  • 刊号:ISSN 1000-9825
  •           CN 11-2560/TP
  • 国内定价:70元
您是第位访问者
版权所有:中国科学院软件研究所 京ICP备05046678号-3
地址:北京市海淀区中关村南四街4号,邮政编码:100190
电话:010-62562563 传真:010-62562533 Email:jos@iscas.ac.cn
技术支持:北京勤云科技发展有限公司

京公网安备 11040202500063号