-
ACT、SmolVLA、Pi0各有什么优势?
-
逆向去噪训练的具体过程是什么?
-
扩散模型为什么能生成机器人动作?
-
VLM在 π0 中的作用?
-
什么是流匹配机制 (Flow Matching)
-
Pi0 网络架构左侧数据来源:π 数据集:自收集的机器人操作数据互联网预训练:大规模网络数据OXE:开源机器人数据集中间核心架构——预训练 VLM(视觉语言模型)SigLIP (400M 参数) + Gemma (2.6B 参数)多个 ViT(视觉变换器)模块处理视觉输入支持语言指令(如"fold shirt" - 折衬衫)右侧动作生成:动作专家(Action expert)模块 (300M 参数)生成动作序列(Action Chunk):a_t, a_{t+1}, …, a_{t+H}查询机制:q_t噪声注入用于训练支持的机器人平台:14 自由度双臂操作器18 自由度移动操作器7 和 8 自由度单臂操作器
-
Pi0训练策略创新Pi0(π0)模型的训练策略创新主要体现在其独特的架构设计和训练方法上,旨在解决通用机器人控制这一复杂任务。引入流匹配(Flow-Matching)架构Pi0在预训练的视觉语言模型(VLM)基础上,创新性地引入了流匹配架构。这是一种生成式建模技术,通过学习一个矢量场来将简单的噪声分布转换为目标的动作分布。与传统的扩散模型相比,流匹配能够更高效地进行训练和推理,从而弥合自然语言指令、视觉观察和机器人控制之间的差距。分层架构与专家网络结合Pi0采用分层架构,结合了强大的预训练模型和专门的专家网络。视觉语言理解 :利用如PaliGemma这样的预训练视觉语言模型,对输入的图像和语言指令进行多模态理解。动作生成 :结合一个基于Gemma的专家网络,将高层的语义理解转化为具体的机器人动作序列。这种结合方式使得模型能够继承互联网规模的语义知识来生成有效的行为指令。创新的动作Token化方案(FAST)为了有效处理机器人高频的连续动作信号,Pi0提出了一种名为“频域动作序列分词”(Frequency-space Action Sequence Tokenization, FAST)的新方案。该方案借鉴了数据压缩和自然语言处理中的分词技术,在训练前对机器人的动作信号进行离散余弦变换(DCT)编码压缩,以减少连续动作token之间的高度相关性,从而稳定训练过程并提升模型性能。知识隔离(Knowledge Insulating)训练策略在后续的改进版本(如Pi0.5)中,研究者进一步提出了“知识隔离”策略,以解决训练过程中的梯度干扰问题。该策略的核心思想是:在通过离散化的动作令牌对视觉语言模型主干进行微调时,同时适配一个生成连续动作的行动专家模块(如流匹配或扩散方法),并阻止该专家模块的梯度反向传播至视觉语言模型主干。这确保了视觉语言模型能专注于学习有效的表征,而不受生成模块未初始化权重的干扰,从而实现“训练快、运行快、泛化好”的目标。
-
当前开源的英文大规模图文数据集已成为推动多模态人工智能发展的关键资源。这类数据集通过提供海量图像与文本的对应关系,为模型学习跨模态表示奠定了数据基础。CC12M、YFCC100M和LAION-400M是其中具有代表性的项目,它们分别在规模、来源与构建方法上展现了不同特点。CC12M由谷歌研究团队发布,包含约1200万对图像与文本数据。其特点在于通过过滤机制从网络爬取原始数据中筛选出质量较高的样本,体现了数据清洗在构建高质量数据集中的重要性。YFCC100M源自Flickr平台,包含1亿张图片及元数据,是早期大规模多媒体数据集的典范。它展现了从现有社区平台获取数据的可行性,但也反映出网络图片分布中存在的噪声问题。LAION-400M则采用CLIP模型进行筛选,通过计算图文相似度得分构建匹配对,这种基于预训练模型的自动化方法显著提升了数据质量。这些数据集的构建方法反映了多模态数据处理的技术演进。从初期的元数据直接采集,到基于规则的过滤,再到利用预训练模型进行语义匹配,数据筛选策略日益精细化。这种演进与自监督学习技术的进步密切相关,特别是对比学习方法的成熟,使得从噪声数据中学习有效表示成为可能。大规模图文数据集对多模态模型发展产生了深远影响。它们直接支撑了CLIP、ALIGN等里程碑式模型的训练,这些模型通过对比学习在隐含空间中对齐图像和文本表示。这种能力进而催生了文生图模型的发展,例如Stable Diffusion就利用了LAION数据集进行训练。同时,这些开源数据集也降低了研究门槛,使更多团队能够参与前沿模型开发。然而,这类数据集也存在值得关注的问题。网络采集的数据可能包含偏见内容,反映并放大了社会文化中的不平等现象。数据版权归属问题尚未完全解决,这对商业化应用构成潜在风险。此外,数据重复现象可能导致模型评估结果虚高,影响对模型真实泛化能力的判断。
-
1. 根本原因:注意力机制的计算复杂度Transformer的核心是自注意力机制,其计算过程需要为序列中的每个词元计算它与序列中所有其他词元的关联度(注意力分数)。这导致了其计算复杂度与序列长度的平方(O(n²))成正比。当序列长度(例如,一个很长的对话)急剧增加时,计算所需的内存和时间会呈爆炸式增长,变得无法承受。为了在有限的算力资源下实现模型的实时响应,开发者必须设定一个上下文窗口长度。这个窗口就像一个“滑动窗口”或“固定大小的黑板”,模型只能看到并处理这个窗口内的内容。举个例子,在您的DeepSeek会话中,当新的对话内容不断产生,旧的、超出窗口长度的内容就会被“推出”黑板,模型自然就无法再“看到”和记起它们了。2. 这不是Transformer的“缺陷”,而是一种“权衡”将这个问题归为“缺陷”可能不够准确。更恰当的表述是,完全精确的、无限长程的自注意力在计算上是不可行的。Transformer的设计者为了获得强大的并行计算能力和对长程依赖的直接捕捉(优于RNN的逐步传递),牺牲了处理无限长序列的内在能力。这是一种经典的工程权衡。事实上,学术界和工业界一直在努力“扩大”这个黑板,并出现了两种主要技术路径:外推法:改进位置编码(如RoPE,即旋转位置编码),让模型在训练时只见过较短文本,但在推理时能一定程度上处理更长的文本。但这有其极限,超出训练范围太远,模型性能会急剧下降。上下文窗口放大:直接使用更长的序列对模型进行继续训练,让其适应更长的上下文。这就是为什么模型会宣传其支持128K、200K等不同的上下文长度。但这需要巨大的计算成本,并且窗口越大,推理速度越慢。3. 更深层次的问题:注意力机制的“稀释效应”即使技术上将上下文窗口扩大到足够大(比如100万字),另一个更本质的问题会出现:注意力机制的“稀释”。想象一下,在一个极长的文本中,模型需要为一个词分配注意力给成千上万个其他词。Softmax函数会将注意力权重分布得极其“稀疏”和“平坦”,导致模型难以聚焦在真正关键的信息上。重要的早期信息可能会被海量的后续信息所“淹没”。这就像在人声鼎沸的体育场里,你很难听清远处某个人的悄悄话,即使你的耳朵在物理上能接收到这个声音。结论因此,大语言模型的“遗忘”问题,其根源在于Transformer自注意力机制固有的计算复杂度瓶颈。当前模型的解决方案是设置一个固定的上下文窗口,这是一种必要的工程妥协。这不是一个可以简单“修复”的bug,而是架构的基础特性。当前的改进方向是不断优化位置编码、以更高成本扩大有效上下文窗口、并发展更高效的注意力算法(如FlashAttention,它优化内存使用而非改变复杂度)。未来的突破可能依赖于全新的架构,例如状态空间模型(如Mamba),它试图用线性复杂度来模拟长序列,但这类模型仍在发展初期,其综合能力尚未超越Transformer。所以,当前尽管AI表现强大,但其内在的工作方式仍存在根本性的约束。
-
Pi0原理介绍Pi0 是由 Physical Intelligence 公司开发的一种通用机器人控制模型。它的核心目标是让机器人能够像人类一样,通过观察和语言指令来理解和执行复杂的任务。一、核心目标与定位Pi0 的根本目标是实现一个 “通用”的视觉-语言-动作 模型。它试图解决传统机器人控制策略的局限性——即一个模型通常只针对一台特定的机器人、在一种特定的环境中、执行一项特定的任务。Pi0 的突破在于,它旨在成为一个 跨本体、跨任务、跨环境 的统一策略。简单来说,就是训练一个模型,让它能适应不同的机器人硬件(如单臂、双臂、移动底盘)、理解多样的自然语言指令,并完成从简单到复杂的操作任务。二、模型架构与关键技术Pi0 的架构可以概括为以下几个核心组成部分:1. 多模态输入编码视觉输入:通常采用多个摄像头的视角(如手腕相机、第三人称俯瞰相机),为模型提供丰富的环境感知信息。语言指令:用户用自然语言下达任务,例如“把桌上的香蕉放到盘子里”。机器人状态:包括关节角度、末端执行器位置等信息。2. 基于流匹配的动作生成这是 Pi0 最核心、最具特色的技术。它没有使用传统的自回归预测(逐个预测动作),而是采用了更先进的 流匹配 技术。流匹配的核心思想:它学习一个向量场,这个向量场能够将一种简单的分布(如高斯噪声) “流动” 并转变为复杂的目标分布(即正确的动作序列)。训练过程:采集一个真实的动作轨迹。从高斯分布中采样一个噪声,并按时间步长将其与真实动作混合,构造出一系列从噪声到真实动作的“路径”。模型的目标是预测这个“流动”的方向(即向量场)。最终,模型学会的是一种将任意噪声“修正”为合理动作的能力。推理过程:从高斯分布中随机采样一个完整的噪声序列。使用学习到的向量场,通过类似欧拉法的数值求解步骤,一步步地将噪声“去噪”成最终要执行的动作序列。这个过程比自回归方式更快。3. 分层模型结构Pi0 的架构大致分为两个阶段或层次:视觉语言模型预训练:首先利用大规模的图像和文本数据,预训练一个强大的视觉语言理解基础(例如,使用类似 PaliGemma 的架构)。这使得模型能够理解“香蕉”、“盘子”、“拿起”等复杂概念。机器人数据训练与微调:使用来自多种机器人形态的专用数据进行训练,使模型具备通用的物理世界理解和动作规划能力。最后,可以使用特定机器人自己采集的数据对模型进行微调,以进一步提升其在特定平台上的性能。三、Pi0 的工作流程输入:模型接收三个关键信息——多摄像头图像、自然语言指令、当前机器人状态。处理:图像和语言被编码到一个共享的表示空间中,与机器人状态进行融合。在流匹配机制的驱动下,模型将随机噪声转换为一个平滑、连续的动作序列。输出:直接生成未来一段时间内机器人需要执行的全部动作。四、Pi0 的主要优势与特点高度的通用性:通过在海量多机器人、多任务数据上训练,Pi0 学到的是一种通用的“技能”,而不是针对某个特定任务的“指令”。这使得它能够将在模拟环境或一种机器人上学到的知识,迁移到真实的或另一种不同的机器人上。高效的动作生成:流匹配技术避免了缓慢的自回归过程,能够一次性生成整个动作轨迹,速度更快。对复杂任务的强大处理能力:特别擅长处理需要双臂协作、长视野规划的任务,例如“折叠衣服”。更好的性能:与之前的模型(如 Open VIO A 和 Grill)相比,Pi0 在实际应用中表现更优。社区复现了其约 80% 的性能,这证明了其方法的有效性。总结Pi0 的原理可以概括为:利用强大的视觉语言模型作为基础,通过流匹配这一先进的生成式AI技术,将多模态的感知信息(视觉、语言)直接映射为精确的机器人控制指令。它代表了机器人技术领域的一个重要发展方向:即不再为每个任务专门编程,而是训练一个统一的、数据驱动的大型模型,使其具备类似人类的通用任务理解和执行能力。其核心创新点在于将 “流匹配” 引入到机器人动作生成领域,从而实现更高效、更通用的机器人控制。
-
AE vs VAE vs CVAE 对比一、核心思想对比模型核心目标关键创新生成能力AE数据压缩与重构无监督学习,编码-解码结构仅能重构输入,生成新样本能力弱VAE学习数据潜在分布,生成多样化样本引入概率编码(潜在变量服从高斯分布)生成多样但不可控的样本CVAE在特定条件下生成可控样本在VAE基础上添加条件变量(如标签、属性)按条件生成多样样本(如指定类别图像)二、结构与数学差异1. 模型结构AE:编码器:输入 x → 潜在向量 z解码器:z → 重构输出 x'无概率建模,直接映射确定值。VAE:编码器:输入 x → 潜在分布的均值 μ 和方差 σ²采样:z = μ + σ·ε(ε 服从标准正态分布,重参数化技巧)解码器:z → 生成数据 x'显式建模概率分布,潜在空间服从高斯先验。CVAE:编码器:输入 x + 条件 c → 潜在分布的 μ 和 σ²解码器:z + 条件 c → 生成符合条件的数据 x'条件信息全程参与(编码与解码阶段)。2. 目标函数模型损失函数AE重构损失(如MSE):$$ L_{AE} = |x - x’|^2 $$VAE重构损失 + KL散度(约束潜在分布接近标准正态):$$ L_{VAE} = |x - x’|^2 + D_{KL}(q(z|x) | p(z)) $$CVAE条件重构损失 + 条件KL散度:$$ L_{CVAE} = |x - x’|^2 + D_{KL}(q(z|x,c) | p(z|c)) $$三、生成能力对比维度AEVAECVAE样本多样性无(仅重构)高(随机采样潜在变量)高(在条件约束下多样化)可控性无法控制无法控制可指定条件生成典型生成示例模糊的重构图像多样但类别混乱的图像指定类别(如“猫”)的图像四、应用场景模型适用场景典型任务AE数据降维、特征提取、去噪图像压缩、异常检测VAE无约束的多样化生成随机图像生成、数据增强CVAE条件控制生成(需指定属性或类别)按文本生成图像、个性化推荐、多模态数据生成(如图→文)五、优缺点总结模型优点缺点AE结构简单,训练高效生成能力弱,无法控制输出VAE生成多样化样本,潜在空间可解释性强生成结果不可控,可能产生不合理样本CVAE精准控制生成属性,同时保持多样性训练复杂度高,需额外条件标注数据六、选择建议需要数据压缩或去噪 → 选择 AE生成多样化但无需控制属性的样本 → 选择 VAE按条件生成特定内容(如指定类别、风格) → 选择 CVAE数据标注充足且需高精度控制 → 可结合 CVAE + GAN(如条件GAN)提升生成质量。
-
条件变分自编码器(CVAE)条件变分自编码器(Conditional Variational Autoencoder, CVAE)是一种强大的生成模型,它在标准变分自编码器(VAE)的基础上引入了 条件变量 ,从而实现了对生成过程的精细控制。简单来说,CVAE的核心思想是:让模型在学习数据分布的同时,也学习如何根据给定的“条件”来生成特定类型的数据。例如,在图像生成任务中,这个“条件”可以是一个类别标签(如“猫”或“狗”),从而让模型能够按需生成指定类别的图像。一、CVAE的工作原理CVAE的整体架构与VAE类似,同样由 编码器(Encoder) 和解码器(Decoder)两部分组成,但关键在于两者都额外接收并融合了 条件变量c 。1. 编码器 (Encoder)输入 :原始数据 x 和条件变量 c。功能 :将输入数据和条件信息进行融合,然后编码成潜在空间(Latent Space)中的一个概率分布,而不是一个固定的点。输出 :这个概率分布通常用两个参数来表示—— 均值μ 和 方差σ² 。2. 解码器 (Decoder)输入 :从潜在空间中随机采样得到的隐变量 z 和条件变量 c。功能 :将隐变量 z 和条件 c 结合起来,学习如何重构原始输入数据 x,或者生成一个全新的、符合该条件的数据样本。输出 :重构或生成的数据 x'。3. 生成过程在生成新数据时,您不再需要提供一个真实的输入 x。您只需要:从一个预先定义好的简单分布(通常是标准正态分布 N(0,1))中随机采样一个隐变量 z。将这个 z 和您想要的 条件变量c 一起输入到解码器中。解码器就会基于这些信息,生成一个满足您所设定条件的全新数据样本。二、CVAE的核心优势可控性 (Controllability)这是CVAE最主要的优势。通过改变输入的条件变量 c,您可以精确地控制生成内容的属性。例如,在文本生成中,c 可以是一个主题标签,从而生成关于该主题的文本。多样性 (Diversity)在满足特定条件的前提下,CVAE仍然能够生成多样化的样本。这是因为隐变量 z 是从一个概率分布中随机采样的,不同的 z 值会导致即使在相同条件下也能产生不同但合理的结果。鲁棒性 (Robustness)通过引入KL散度等正则化项,CVAE能够确保潜在空间中的变量遵循预定义的分布,从而提高了模型的稳定性和鲁棒性。三、CVAE的应用领域CVAE因其出色的可控生成能力,在多个领域都有广泛应用:图像生成 :根据类别标签(如数字0-9)、属性(如年龄、性别)生成特定的人脸或物体图像。文本创作 :根据给定的主题、风格或情感基调生成相应的文本内容。风格迁移 :将一幅图像的风格应用到另一幅图像上,生成具有新风格的图像。金融预测 :结合历史数据和其他特征,生成未来可能的波动率曲面。
-
马尔可夫任务与非马尔可夫任务的核心区别两者的本质差异在于 系统未来状态的依赖性:马尔可夫任务:未来状态仅由当前状态决定,与历史无关(无记忆性)。非马尔可夫任务:未来状态依赖当前状态 及 历史路径(路径依赖或长程关联)。分维度对比维度马尔可夫任务非马尔可夫任务状态定义当前状态需包含所有关键信息(如自动驾驶的坐标+速度)需显式编码历史信息(如交通拥堵预测需前10分钟路况)数学表达$$ P(S_{t+1} | S_t) $$$$ P(S_{t+1} | S_t, S_{t-1}, …, S_0) $$建模复杂度低(状态空间小,转移矩阵固定)高(需处理时序依赖,如LSTM/Transformer)实时性延迟低(<200ms,适合实时控制)延迟较高(需处理历史序列,推理耗时增加30%~50%)典型算法MDP(马尔可夫决策过程)、Q-LearningPOMDP(部分可观测MDP)、DRL(深度强化学习)应用场景棋类游戏AI、设备实时控制、文本n-gram生成金融趋势预测、医疗诊断、自然语言指代消解关键差异详解一、 状态依赖机制马尔可夫任务:系统设计需确保当前状态包含所有必要信息(状态完备性)。示例:国际象棋AI仅需当前棋盘布局即可决策下一步,无需考虑棋局历史。非马尔可夫任务:需引入历史编码(如LSTM隐状态)或扩展状态空间(如将$$ S_t’ = (S_t, S_{t-1}) $$)。示例:自动驾驶在动态交通中需记忆前车过去5秒的变道行为,以预测其意图。二、 建模与计算马尔可夫任务:通过状态转移矩阵或动态规划(如值迭代)快速求解。优势:理论收敛性明确(Bellman方程保证最优策略)。非马尔可夫任务:依赖序列建模技术(如Transformer的注意力机制)捕捉长程依赖。挑战:可能陷入局部最优,需大量数据训练(如AlphaFold预测蛋白质结构需数亿样本)。三、 典型场景对比场景马尔可夫任务非马尔可夫任务金融预测明日股价涨跌分类(当前K线形态)未来一月趋势预测(依赖历史波动模式)医疗诊断实时心率异常检测(当前ECG信号)癌症复发风险评估(需3年病史数据)机器人控制机械臂抓取(当前物体位置+姿态)家庭服务机器人长期任务规划(记忆用户习惯)为何非马尔可夫任务更难处理?维度灾难:历史信息引入导致状态空间指数级膨胀。延迟奖励:动作的长期影响需回溯历史(如围棋中某步棋的价值可能百步后显现)。部分可观测性:真实场景中传感器信息不完整,需推断隐含状态(如通过语音片段推断对话上下文)。工程实践中的平衡策略近似马尔可夫化:用注意力机制提取关键历史片段(如Transformer保留最近10步状态)。案例:谷歌翻译通过自注意力捕捉句子中长距离语法依赖。分层建模:高层任务(战略规划)用非马尔可夫模型,底层控制(战术执行)用马尔可夫模型。案例:仓储机器人全局路径规划(历史依赖)与实时避障(当前状态依赖)分离。元学习适配:动态调整历史窗口长度(如交通预测中早高峰用长窗口,平峰期用短窗口)。总结:选择马尔可夫或非马尔可夫模型取决于任务是否具有历史依赖性。工业实践中,常通过模型压缩或特征工程将非马尔可夫问题转化为近似马尔可夫形式,以平衡效率与准确性。
-
非马尔可夫任务示例一、金融时间序列中的趋势预测任务描述:预测股票价格的长期趋势(例如,未来一个月是否会持续上涨),而非仅仅判断下一个时间点的涨跌。非马尔可夫特性体现:路径依赖性: 股价的长期趋势强烈依赖于其达到当前价格的历史路径。例如,一只股票经过连续三周的大幅上涨后,其后续回调或继续上涨的概率分布,与一只缓慢爬升至同一价格的股票截然不同。记忆效应: 技术分析中的“趋势线”和“支撑位/阻力位”概念,正是利用了市场对历史价格走势的记忆效应。模型必须记住价格如何到达当前位置,才能做出有效的趋势预测。二、交通网络中的拥堵预测任务描述:预测城市主干道在未来30分钟内是否会出现严重拥堵。非马尔可夫特性体现:状态持续性: 交通拥堵状态具有显著的持续性。如果一条路当前处于拥堵状态,它未来几分钟内仍处于拥堵的概率远高于从畅通直接变为拥堵的概率。长程相关性: 上游路段的拥堵会在数分钟后波及下游。因此,预测下游路段的状态时,不仅要考虑其当前状态,还必须纳入上游路段在几分钟前的历史状态作为关键信息。三、自然语言处理中的指代消解任务描述:在一段文本中,确定一个代词(如“它”、“他们”)具体指代的是哪个前文提到的名词实体。非马尔可夫特性体现:强历史依赖: 代词的含义完全由其所在上下文的历史信息决定。例如,在句子“猫追老鼠。它爬上了树。”中,要确定“它”指的是“猫”还是“老鼠”,必须理解整个事件的发展过程和逻辑主语。上下文窗口: 任何有效的模型都必须将代词之前的一大段文本(即历史信息)作为输入,而不能仅依赖当前词或上一个词的状态。四、强化学习中的部分可观测马尔可夫决策过程 (POMDP)任务描述:训练一个智能体(Agent)在信息不完整的环境中做出最优决策。例如,训练一个机器人在黑暗的房间里导航,机器人只能感知到局部的、不完整的环境信息。非马尔可夫特性体现:信念状态: 由于无法获得环境的完整状态,智能体必须维护一个“信念状态”,该状态是对所有可能历史路径的概率分布的总结。记忆是关键: 智能体的决策必须基于对过去所有观测的记忆(即信念状态),因为单次观测不足以推断出完整的环境状态。这使得任务本质上是非马尔可夫的。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签