• [互动交流] 扩散模型如何迭代优化机器人动作?
    扩散模型如何迭代优化机器人动作?
  • [互动交流] 视觉编码器和语言模型如何融合?
    视觉编码器和语言模型如何融合?
  • [互动交流] 为什么模型跑在不同的芯片上要进行算子的适配?
    为什么模型跑在不同的芯片上要进行算子的适配?
  • [互动交流] LLM与VLM有什么区别?
    LLM与VLM有什么区别?
  • [互动交流] ACT、SmolVLA、Pi0各有什么优势?
    ACT、SmolVLA、Pi0各有什么优势?
  • [互动交流] 逆向去噪训练的具体过程是什么?
    逆向去噪训练的具体过程是什么?
  • [互动交流] 扩散模型为什么能生成机器人动作?
    扩散模型为什么能生成机器人动作?
  • [互动交流] VLM在 π0 中的作用?
    VLM在 π0 中的作用?
  • [互动交流] 什么是VLM?
    VLM指的什么模型?
  • [互动交流] 什么是流匹配机制 (Flow Matching)
    什么是流匹配机制 (Flow Matching)
  • [技术干货] Pi0 网络架构
    Pi0 网络架构左侧数据来源:π 数据集:自收集的机器人操作数据互联网预训练:大规模网络数据OXE:开源机器人数据集中间核心架构——预训练 VLM(视觉语言模型)SigLIP (400M 参数) + Gemma (2.6B 参数)多个 ViT(视觉变换器)模块处理视觉输入支持语言指令(如"fold shirt" - 折衬衫)右侧动作生成:动作专家(Action expert)模块 (300M 参数)生成动作序列(Action Chunk):a_t, a_{t+1}, …, a_{t+H}查询机制:q_t噪声注入用于训练支持的机器人平台:14 自由度双臂操作器18 自由度移动操作器7 和 8 自由度单臂操作器
  • [技术干货] Pi0训练策略创新
    Pi0训练策略创新Pi0(π0)模型的训练策略创新主要体现在其独特的架构设计和训练方法上,旨在解决通用机器人控制这一复杂任务。引入流匹配(Flow-Matching)架构Pi0在预训练的视觉语言模型(VLM)基础上,创新性地引入了流匹配架构。这是一种生成式建模技术,通过学习一个矢量场来将简单的噪声分布转换为目标的动作分布。与传统的扩散模型相比,流匹配能够更高效地进行训练和推理,从而弥合自然语言指令、视觉观察和机器人控制之间的差距。分层架构与专家网络结合Pi0采用分层架构,结合了强大的预训练模型和专门的专家网络。视觉语言理解 :利用如PaliGemma这样的预训练视觉语言模型,对输入的图像和语言指令进行多模态理解。动作生成 :结合一个基于Gemma的专家网络,将高层的语义理解转化为具体的机器人动作序列。这种结合方式使得模型能够继承互联网规模的语义知识来生成有效的行为指令。创新的动作Token化方案(FAST)为了有效处理机器人高频的连续动作信号,Pi0提出了一种名为“频域动作序列分词”(Frequency-space Action Sequence Tokenization, FAST)的新方案。该方案借鉴了数据压缩和自然语言处理中的分词技术,在训练前对机器人的动作信号进行离散余弦变换(DCT)编码压缩,以减少连续动作token之间的高度相关性,从而稳定训练过程并提升模型性能。知识隔离(Knowledge Insulating)训练策略在后续的改进版本(如Pi0.5)中,研究者进一步提出了“知识隔离”策略,以解决训练过程中的梯度干扰问题。该策略的核心思想是:在通过离散化的动作令牌对视觉语言模型主干进行微调时,同时适配一个生成连续动作的行动专家模块(如流匹配或扩散方法),并阻止该专家模块的梯度反向传播至视觉语言模型主干。这确保了视觉语言模型能专注于学习有效的表征,而不受生成模块未初始化权重的干扰,从而实现“训练快、运行快、泛化好”的目标。
  • [技术干货] 开源英文图文数据集介绍
    当前开源的英文大规模图文数据集已成为推动多模态人工智能发展的关键资源。这类数据集通过提供海量图像与文本的对应关系,为模型学习跨模态表示奠定了数据基础。CC12M、YFCC100M和LAION-400M是其中具有代表性的项目,它们分别在规模、来源与构建方法上展现了不同特点。CC12M由谷歌研究团队发布,包含约1200万对图像与文本数据。其特点在于通过过滤机制从网络爬取原始数据中筛选出质量较高的样本,体现了数据清洗在构建高质量数据集中的重要性。YFCC100M源自Flickr平台,包含1亿张图片及元数据,是早期大规模多媒体数据集的典范。它展现了从现有社区平台获取数据的可行性,但也反映出网络图片分布中存在的噪声问题。LAION-400M则采用CLIP模型进行筛选,通过计算图文相似度得分构建匹配对,这种基于预训练模型的自动化方法显著提升了数据质量。这些数据集的构建方法反映了多模态数据处理的技术演进。从初期的元数据直接采集,到基于规则的过滤,再到利用预训练模型进行语义匹配,数据筛选策略日益精细化。这种演进与自监督学习技术的进步密切相关,特别是对比学习方法的成熟,使得从噪声数据中学习有效表示成为可能。大规模图文数据集对多模态模型发展产生了深远影响。它们直接支撑了CLIP、ALIGN等里程碑式模型的训练,这些模型通过对比学习在隐含空间中对齐图像和文本表示。这种能力进而催生了文生图模型的发展,例如Stable Diffusion就利用了LAION数据集进行训练。同时,这些开源数据集也降低了研究门槛,使更多团队能够参与前沿模型开发。然而,这类数据集也存在值得关注的问题。网络采集的数据可能包含偏见内容,反映并放大了社会文化中的不平等现象。数据版权归属问题尚未完全解决,这对商业化应用构成潜在风险。此外,数据重复现象可能导致模型评估结果虚高,影响对模型真实泛化能力的判断。
  • [技术干货] 大语言模型为何会“忘记”?Transformer的上下文窗口瓶颈解析
    1. 根本原因:注意力机制的计算复杂度Transformer的核心是自注意力机制,其计算过程需要为序列中的每个词元计算它与序列中所有其他词元的关联度(注意力分数)。这导致了其计算复杂度与序列长度的平方(O(n²))成正比。当序列长度(例如,一个很长的对话)急剧增加时,计算所需的内存和时间会呈爆炸式增长,变得无法承受。为了在有限的算力资源下实现模型的实时响应,开发者必须设定一个上下文窗口长度。这个窗口就像一个“滑动窗口”或“固定大小的黑板”,模型只能看到并处理这个窗口内的内容。举个例子,在您的DeepSeek会话中,当新的对话内容不断产生,旧的、超出窗口长度的内容就会被“推出”黑板,模型自然就无法再“看到”和记起它们了。2. 这不是Transformer的“缺陷”,而是一种“权衡”将这个问题归为“缺陷”可能不够准确。更恰当的表述是,完全精确的、无限长程的自注意力在计算上是不可行的。Transformer的设计者为了获得强大的并行计算能力和对长程依赖的直接捕捉(优于RNN的逐步传递),牺牲了处理无限长序列的内在能力。这是一种经典的工程权衡。事实上,学术界和工业界一直在努力“扩大”这个黑板,并出现了两种主要技术路径:外推法:改进位置编码(如RoPE,即旋转位置编码),让模型在训练时只见过较短文本,但在推理时能一定程度上处理更长的文本。但这有其极限,超出训练范围太远,模型性能会急剧下降。上下文窗口放大:直接使用更长的序列对模型进行继续训练,让其适应更长的上下文。这就是为什么模型会宣传其支持128K、200K等不同的上下文长度。但这需要巨大的计算成本,并且窗口越大,推理速度越慢。3. 更深层次的问题:注意力机制的“稀释效应”即使技术上将上下文窗口扩大到足够大(比如100万字),另一个更本质的问题会出现:注意力机制的“稀释”。想象一下,在一个极长的文本中,模型需要为一个词分配注意力给成千上万个其他词。Softmax函数会将注意力权重分布得极其“稀疏”和“平坦”,导致模型难以聚焦在真正关键的信息上。重要的早期信息可能会被海量的后续信息所“淹没”。这就像在人声鼎沸的体育场里,你很难听清远处某个人的悄悄话,即使你的耳朵在物理上能接收到这个声音。结论因此,大语言模型的“遗忘”问题,其根源在于Transformer自注意力机制固有的计算复杂度瓶颈。当前模型的解决方案是设置一个固定的上下文窗口,这是一种必要的工程妥协。这不是一个可以简单“修复”的bug,而是架构的基础特性。当前的改进方向是不断优化位置编码、以更高成本扩大有效上下文窗口、并发展更高效的注意力算法(如FlashAttention,它优化内存使用而非改变复杂度)。未来的突破可能依赖于全新的架构,例如状态空间模型(如Mamba),它试图用线性复杂度来模拟长序列,但这类模型仍在发展初期,其综合能力尚未超越Transformer。所以,当前尽管AI表现强大,但其内在的工作方式仍存在根本性的约束。
  • [技术干货] Pi0原理介绍
    Pi0原理介绍Pi0 是由 Physical Intelligence 公司开发的一种通用机器人控制模型。它的核心目标是让机器人能够像人类一样,通过观察和语言指令来理解和执行复杂的任务。一、核心目标与定位Pi0 的根本目标是实现一个 “通用”的视觉-语言-动作 模型。它试图解决传统机器人控制策略的局限性——即一个模型通常只针对一台特定的机器人、在一种特定的环境中、执行一项特定的任务。Pi0 的突破在于,它旨在成为一个 跨本体、跨任务、跨环境 的统一策略。简单来说,就是训练一个模型,让它能适应不同的机器人硬件(如单臂、双臂、移动底盘)、理解多样的自然语言指令,并完成从简单到复杂的操作任务。二、模型架构与关键技术Pi0 的架构可以概括为以下几个核心组成部分:1. 多模态输入编码视觉输入:通常采用多个摄像头的视角(如手腕相机、第三人称俯瞰相机),为模型提供丰富的环境感知信息。语言指令:用户用自然语言下达任务,例如“把桌上的香蕉放到盘子里”。机器人状态:包括关节角度、末端执行器位置等信息。2. 基于流匹配的动作生成这是 Pi0 最核心、最具特色的技术。它没有使用传统的自回归预测(逐个预测动作),而是采用了更先进的 流匹配 技术。流匹配的核心思想:它学习一个向量场,这个向量场能够将一种简单的分布(如高斯噪声) “流动” 并转变为复杂的目标分布(即正确的动作序列)。训练过程:采集一个真实的动作轨迹。从高斯分布中采样一个噪声,并按时间步长将其与真实动作混合,构造出一系列从噪声到真实动作的“路径”。模型的目标是预测这个“流动”的方向(即向量场)。最终,模型学会的是一种将任意噪声“修正”为合理动作的能力。推理过程:从高斯分布中随机采样一个完整的噪声序列。使用学习到的向量场,通过类似欧拉法的数值求解步骤,一步步地将噪声“去噪”成最终要执行的动作序列。这个过程比自回归方式更快。3. 分层模型结构Pi0 的架构大致分为两个阶段或层次:视觉语言模型预训练:首先利用大规模的图像和文本数据,预训练一个强大的视觉语言理解基础(例如,使用类似 PaliGemma 的架构)。这使得模型能够理解“香蕉”、“盘子”、“拿起”等复杂概念。机器人数据训练与微调:使用来自多种机器人形态的专用数据进行训练,使模型具备通用的物理世界理解和动作规划能力。最后,可以使用特定机器人自己采集的数据对模型进行微调,以进一步提升其在特定平台上的性能。三、Pi0 的工作流程输入:模型接收三个关键信息——多摄像头图像、自然语言指令、当前机器人状态。处理:图像和语言被编码到一个共享的表示空间中,与机器人状态进行融合。在流匹配机制的驱动下,模型将随机噪声转换为一个平滑、连续的动作序列。输出:直接生成未来一段时间内机器人需要执行的全部动作。四、Pi0 的主要优势与特点高度的通用性:通过在海量多机器人、多任务数据上训练,Pi0 学到的是一种通用的“技能”,而不是针对某个特定任务的“指令”。这使得它能够将在模拟环境或一种机器人上学到的知识,迁移到真实的或另一种不同的机器人上。高效的动作生成:流匹配技术避免了缓慢的自回归过程,能够一次性生成整个动作轨迹,速度更快。对复杂任务的强大处理能力:特别擅长处理需要双臂协作、长视野规划的任务,例如“折叠衣服”。更好的性能:与之前的模型(如 Open VIO A 和 Grill)相比,Pi0 在实际应用中表现更优。社区复现了其约 80% 的性能,这证明了其方法的有效性。总结Pi0 的原理可以概括为:利用强大的视觉语言模型作为基础,通过流匹配这一先进的生成式AI技术,将多模态的感知信息(视觉、语言)直接映射为精确的机器人控制指令。它代表了机器人技术领域的一个重要发展方向:即不再为每个任务专门编程,而是训练一个统一的、数据驱动的大型模型,使其具备类似人类的通用任务理解和执行能力。其核心创新点在于将 “流匹配” 引入到机器人动作生成领域,从而实现更高效、更通用的机器人控制。
总条数:7838 到第
上滑加载中