• [技术干货] MAE与BEIT:ViT高效预训练的双重路径
    ViT的成功揭示了一个关键前提: Transformer架构在视觉任务中潜力的释放,严重依赖于大规模数据预训练。这自然引出了下一个核心研究问题:如何设计更高效、更强大的预训练范式,以降低对数据量的极端依赖,并进一步提升ViT的性能。MAE和BEIT正是在这个方向上取得的代表性突破,它们分别从重建原始信号和学习语义概念两个不同角度,革新了ViT的预训练方法。BEIT(Bidirectional Encoder representation from Image Transformers)率先将自然语言处理中的掩码语言建模思想成功迁移到视觉领域,但其关键创新在于将重建目标从原始像素提升到了语义层面。它引入了一个预训练好的图像标记器,将图像块映射为离散的视觉词汇。在预训练时,BEIT随机掩码一部分图像块,然后要求Transformer模型根据上下文预测这些被掩码区域所对应的视觉词汇ID。这种方法的优势在于,它迫使模型学习的是图像的抽象语义表示,而非低层次的像素细节,这与下游任务(如分类、分割)的目标更为一致,为模型提供了更强的语义理解能力。与BEIT的“概念预测”路径不同,MAE(Masked Autoencoders)则回归到了像素重建,但通过一种极其简洁而非对称的编码器-解码器架构,将其效率与效能提升到了新高度。MAE的核心思想是极高的掩码率(如75%),只将极少量的、未被掩码的图像块送入Transformer编码器,从而极大地降低了预训练的计算和内存开销。之后,一个轻量的解码器将编码器输出的潜在特征与被掩码的令牌拼接,负责重建被掩码区域的原始像素值。这种设计使得MAE能够训练非常庞大的模型,并通过让模型从少量线索中推断完整图像,有效地学习了强大的图像表征和结构先验。这两项工作的成就不仅在于它们在当时多个基准任务上取得了领先性能,更在于它们为视觉预训练提供了新的范式。BEIT证明了基于语义概念的掩码建模是可行的,启发了后续一系列以语义驱动为目标的工作。MAE则以其惊人的简洁性和高效性,证明了非对称设计与像素级重建在极大掩码率下依然有效,极大地推动了掩码自编码器在视觉领域的复兴。它们共同表明,在ViT的架构基础上,通过设计更精巧的预训练任务,可以更充分地激发模型的潜力,减少对海量标注数据的依赖,是推动视觉表征学习向前发展的核心动力。
  • [技术干货] Vision Transformer (ViT):纯注意力架构对视觉领域的重塑
    Vision Transformer (ViT) 是2020年由Google Research团队提出,其核心贡献在于首次证明,在无需卷积归纳偏置的情况下,纯Transformer架构在图像分类任务上经过大规模预训练后,能够达到甚至超越当时最先进的卷积神经网络(CNN)的性能。这一发现挑战了计算机视觉领域长期以来的一个基本假设:即局部性、平移不变性等卷积固有的归纳偏置对于视觉表征学习是必不可少的。ViT的设计理念极为直接:它将图像视为一个序列。具体而言,模型将输入图像分割成一系列固定大小的图像块(Patch),将这些图像块线性展平并映射为嵌入向量,再加入可学习的位置嵌入以保留空间信息。随后,这个图像块序列被直接送入一个标准Transformer编码器进行处理,其处理方式与处理文本词嵌入序列完全相同。ViT的成功关键在于其对大数据的依赖。论文明确指出,当在中等规模的数据集(如ImageNet)上训练时,ViT模型的表现会逊于同等规模的CNN(如ResNet),这印证了在没有卷积局部偏置的情况下,模型需要更多的数据来从零学习这些视觉基础规律。然而,当预训练数据集的规模极大(如它们使用的JFT-300M,包含3亿张图像)时,Transformer强大的全局建模能力和可扩展性便得到了充分发挥。模型能够通过自注意力机制,自主学习图像块之间的复杂依赖关系,包括远距离的语义关联和精细的局部结构,从而实现了卓越的性能。ViT的成就与影响是深远的。首先,它打破了CNN在计算机视觉领域的长期垄断,确立了一种全新的、纯粹基于自注意力的视觉主干网络范式。其次,它揭示了“规模”本身作为一种强大驱动力的潜力:足够的数据和模型容量可以弥补甚至超越精心设计的归纳偏置。最后,它为多模态研究(尤其是视觉-语言模型)带来了革命性的便利。在ViT之前,像LXMERT、UNITER等模型需要依赖CNN提取区域或网格特征,再与文本Transformer融合,流程复杂。ViT之后,视觉和语言可以直接在统一的Transformer架构中进行端到端处理,这极大地简化了多模态模型的设计,直接催生了如ViLT、ALBEF等新一代模型,推动了整个领域向更简洁、统一的框架演进。
  • [技术干货] Pixel-BERT:基于网格特征的多模态端到端学习路径
    Pixel-BERT发表于2021年,其核心动机是为了解决当时主流多模态模型(如LXMERT、UNITER)对预提取区域特征(Region Features)的依赖。这种依赖被视为一个关键瓶颈,因为它需要运行复杂的目标检测器(如Faster R-CNN),流程繁琐、计算成本高,且检测器本身在训练数据上的局限性可能制约模型对更广泛视觉概念的感知。Pixel-BERT的提出,标志着从区域特征 到网格特征 的范式转变。该模型的设计思想是“简单与统一”。它摒弃了目标检测器,直接利用CNN骨干网络(如ResNet)最后一层卷积输出的特征图作为视觉输入。这些密集的图像网格特征与文本词嵌入一起,被随机拼接并送入一个统一的Transformer编码器中。在这个共享的Transformer内部,通过自注意力机制同时进行模态内和模态间的融合。这种方法实现了真正的端到端训练,简化了整体流程,并让模型能够从原始像素信息中自主发现并关注有意义的视觉元素。Pixel-BERT的预训练任务也配合了这一架构特点。它主要采用了掩码语言建模和图像-文本匹配。特别值得注意的是,为了应对网格特征噪声更大、语义抽象度更低的问题,它提出了随机图像块采样 策略。即在每轮训练中,随机从完整特征图中采样一部分图像块进行输入,这本质上是一种数据增强,强制模型不能依赖于固定的少数显著区域,而必须学习从更广泛的视觉上下文中整合信息,从而提升了模型的鲁棒性和泛化能力。Pixel-BERT的成就在于它成功地验证了基于网格特征的多模态预训练的可行性。它表明,即使不依赖昂贵且可能带有偏见的预训练检测器,模型同样可以学习到强大的跨模态表示能力,并在VQA、图像检索等任务上达到与基于区域特征的先进模型相媲美的性能。它的重要意义在于为多模态领域开辟了一条新的、更简洁的技术路径,直接启发了后续如ViLT等完全基于Vision Transformer的模型,推动了多模态学习向着更端到端、更统一的方向演进。
  • [技术干货] UNITER:基于区域特征的多模态预训练典范
    UNITER模型由微软研究院在2020年提出,可被视为基于区域特征的多模态预训练方法的集大成者。它在LXMERT等先驱工作的基础上,进行了关键性的优化与统一,将“图像作为区域序列”与文本进行融合的这一技术路线推向了成熟。其核心架构是典型的双流编码器,图像和文本先经过各自的Transformer编码器,再通过多层跨模态Transformer进行深度融合。UNITER的核心突破在于其预训练策略的精细化与系统性。它不仅包含了掩码语言建模、图像-文本匹配等经典任务,还创新性地引入了掩码区域建模 和单词-区域对齐。掩码区域建模要求模型在给定文本的条件下,恢复被遮蔽的图像区域特征,这与掩码语言建模形成了对称的、双向的预训练信号。而单词-区域对齐则通过最优传输理论,在更细的粒度上学习单词与图像区域之间的软对齐关系,极大地增强了对复杂场景中细节关联的建模能力。UNITER的另一个关键成就是其在大规模数据构建与使用上的严谨性。它系统地整合了多个公开数据集,并强调了数据多样性对模型泛化能力的重要性。在训练技巧上,UNITER采用了条件掩码策略,即在执行掩码时,始终以另一个完整模态作为条件,这有效避免了模型在预训练与微调阶段因数据分布差异而出现的性能损失。该模型的成就体现在它在其发布时横扫了包括VQA、NLVR2、Visual Entailment在内的多项主要多模态基准测试,并长时间保持领先,充分证明了其设计理念的有效性。更重要的是,UNITER通过一套极其完整和严谨的框架,为基于区域特征的多模态预训练树立了典范。它清晰地展示了如何通过精心设计的预训练任务、高质量的大规模数据以及稳定的训练方法,将这一路线的性能挖掘到接近极限。尽管后续端到端方法因效率优势逐渐成为主流,但UNITER所确立的许多预训练范式和学习目标,至今仍是多模态领域共享的技术财富。
  • [技术干货] LXMERT:早期视觉-语言深度融合的典范与其技术遗产
    作为2019年诞生的多模态模型,LXMERT的核心贡献在于系统性地验证了通过大规模预训练实现视觉与语言深度融合的可行性。它采用了一个结构清晰的双流编码器架构:视觉和语言输入首先分别通过各自的自注意力层进行模态内表征,随后再经过一系列精心设计的交叉注意力Transformer层进行模态间交互。这种先独立后融合的范式,在当时有效地平衡了模型复杂度和特征交互的深度,为后续研究提供了一个可复现的坚实基线。在预训练任务设计上,LXMERT整合了掩码语言建模、视觉-语言匹配和物体标签预测。这三项任务的组合并非随意,而是旨在从不同粒度迫使模型建立视觉信号与语言符号之间的关联。掩码语言建模让模型学习用图像信息补全文本,视觉-语言匹配要求模型理解图文整体的语义一致性,而物体标签预测则直接推动视觉区域与特定概念词的绑定。这种多任务协同的预训练策略,成为此后多模态预训练工作的标准配置。LXMERT的成就直接体现在其当时在多项基准测试(如VQA、GQA、NLVR2)上取得的领先性能,证明了深度跨模态融合的巨大潜力。然而,其更深远的影响在于为领域留下的技术遗产与明确的发展方向。它的成功启发了VL-BERT、UNITER等一系列同样基于双流和交叉注意力的改进模型,同时,其局限性——例如对预提取视觉特征的依赖以及双流结构带来的计算成本——也清晰地指向了下一个需要攻克的技术节点。这直接推动了后续如ViLT等端到端单流模型的发展,致力于在保持强大融合能力的同时提升效率。因此,LXMERT在学术演进脉络中,更像是一个承前启后的关键路标,它既巩固了一个行之有效的技术路径,也通过自身的设计边界,预示了未来变革的方向。
  • 【话题交流】10月已经结束,大家还在学习新知识嘛?
    【话题交流】10月已经结束,大家还在学习新知识嘛?
  • [新特性] 版本速递 | 华为云Versatile智能体平台 新增特性介绍(2025年10月发布)
     (2025年10月)  < 华为云Versatile智能体平台 体验入口>华为开发者空间--开发平台--Versatile Agent (请在PC端打开)  版本概览  Summary   华为云Versatile智能体平台定位为一站式企业级智能体构建平台,倡导人人都能构建自己的企业级智能体。本次十月版本升级围绕MCP服务、工作流应用、知识库、插件、工作空间等模块实现10+项特性优化,全力为开发者们在创建创意智能体过程中带来更流畅的体验,与开发者合力构建易用、好用、开放的AI Agent平台。   新增重点特性介绍  Introduction     01  资产中心  资产中心 · MCP广场 新增80+官方预置MCP工具,总数累计达100业务价值:丰富MCP资产的类型与数量,开箱即用,降低开发门槛,为用户带来更流畅的开发体验。   02 Agent发布     应用管理 · 支持单智能体应用、工作流应用发布为网页,可在web端打开Agent进行快速交互。业务价值:通过一键发布,生成链接,支持在web端以网页形式快捷访问智能体应用,丰富打开方式。    03  工作流节点   应用管理-工作流应用 · 新增异常节点功能,用户可以根据业务需求自定义异常信息。可通过直接输入或插入创建好的消息模板,在异常码抛出中输入异常信息。业务价值:可由用户自主抛出业务异常。异常节点用于抛出预定义的业务异常码,可传递给中控进行后续处理。   配置管理 · 新增消息模板功能,用户可以自定义消息模板,并在工作流应用的对应节点中使用。(如:异常分类的消息模板可以在异常节点中使用)业务价值:通过将消息完成结构化创建存为模板,实现租户或工作空间内的共享;方便在节点创建时直接选用模板,简化操作。  应用管理-工作流应用 · 工作流应用在编排节点配置时,支持通过搜索栏输入关键词,快速定位所需引用参数业务价值:提供关键词搜索能力,方便用户快速定位所需参数,提升筛选效率。   · 消息节点支持引用流式和非流式输出参数业务价值:丰富消息节点的引用模式。  04  数据能力   知识库 · 知识库新增查看引用功能,提供引用列表,可查看当前知识库被哪些智能体和工作流引用业务价值:提供知识库被引用关系溯源,便于清晰查看知识库被引用的路径,用于判断知识库变更对哪些Agent、检索流产生影响。    05 插件能力   组件库-我的插件 · 创建插件支持多工具管理,一个插件下可以新建多个相关工具业务价值:优化插件创建流程,实现插件的多工具集合管理,通过类别划分支撑插件在智能体选用时更为便捷。  应用管理 · 在智能体及工作流应用中,灵活选择多个插件下的工具或一个插件下的多个工具。业务价值:提高插件选择的便捷性,优化用户体验。   06  工作空间  工作空间 · 工作空间角色优化,增加开发工程师、运维工程师业务价值:通过增加特定角色,优化对团队空间的操作权限细分,方便组织内多岗位成员协作,显著提升团队的工作效率。    07  模型管理  模型调测· 模型服务调测时,支持一键清除输入内容业务价值:一键快速清除,提升模型调测的操作效率。  08  开发中心   应用管理· 单智能体应用、工作流应用在“发布管理”页面支持复制URL业务价值:可一键复制,简化操作,提升用户体验。 · 调用工作流应用接口,增加响应参数业务价值:补充响应参数信息,方便调用查看。 点击可前往>>华为云Versatile智能体平台 官网   
  • [技术干货] 10月份人工智能【FAQ合集】来了!
    10月份人工智能【FAQ合集】来了!本月FAQ涵盖五大技术领域:竞赛算力聚焦ICT大赛资源分配策略;生成模型中流匹配通过概率路径优化数据分布,扩散模型利用逆向去噪生成机器人动作(含扩散与重建阶段),逆向训练实现噪声到数据的恢复;多模态领域VLM融合视觉语言处理(CLIP双塔/交叉注意力),在机器人系统中解析环境指令,与文本专用LLM形成对比;机器人框架ACT/SMoLVLa/Pi0分别侧重动作生成、多模态学习与任务泛化;硬件层面需针对GPU/NPU芯片的算子指令差异进行适配优化。完整内容可通过原帖链接查看技术细节。ICT大赛创新赛道赛题一算力获取案例数据集无法下载什么是流匹配机制 (Flow Matching)什么是VLM?VLM在 π0 中的作用?扩散模型为什么能生成机器人动作?逆向去噪训练的具体过程是什么?ACT、SmolVLA、Pi0各有什么优势?LLM与VLM有什么区别?为什么模型跑在不同的芯片上要进行算子的适配?视觉编码器和语言模型如何融合?扩散模型如何迭代优化机器人动作?不同芯片对算子支持的差异有哪些?
  • [技术干货] LLaMA-Factory多机多卡训练
    LLaMA-Factory多机多卡训练为了在多机多卡环境下训练大模型,我们可以使用LLaMA-Factory。它支持多种常见模型,集成了包括(增量)预训练、(多模态)指令监督微调、奖励模型训练、PPO 训练、DPO 训练、KTO 训练、ORPO 训练等等训练方法,并且有web-ui和命令行两种使用方式,是目前主流的模型训练框架之一。1 安装LLaMa-Factory下载 LLAMA-Factory 并进入项目目录,本文档所有操作均在该目录下进行:git clone https://github.com/hiyouga/LLaMA-Factory.gitcd LLaMA-Factory2、Python 环境创建创建并激活 Python 环境:conda create -y -n llamafactory python=3.10conda activate llamafactory3、LaMA-Factory 安装使用以下指令安装带有 torch-npu 的 LLaMA-Factory:pip install -e “.[torch-npu,metrics]” -i https://pypi.tuna.tsinghua.edu.cn/simple使用自定义数据集时,需要更新 data/dataset_info.json 文件。image.png多机多卡训练LLaMA-Factory支持多种多机多卡训练方式,包括DDP,DeepSpeed,FSDP。针对想要使用 NativeDDP 或 DeepSpeed 两种分布式训练引擎,推荐使用下列命令,区分两种训练引擎仅仅在于训练的yaml参数文件中。然后,必须在每个节点上使用export HCCL_SOCKET_IFNAME=eth0 来指定当前节点的 HCCL 通信网卡(请使用目标网卡名替换 eth0)。以两机环境为例,分别在主、从节点(机器)上执行如下两条命令即可启动多机训练:FORCE_TORCHRUN=1 NNODES=2 RANK=0 STER_ADDR=192.168.0.1 MASTER_PORT=29500 llamafactory-cli train examples/train_lora/llama3_lora_sft.yaml 主节点运行FORCE_TORCHRUN=1 NNODES=2 RANK=1STER_ADDR=192.168.0.1 MASTER_PORT=29500 llamafactory-cli train examples/train_lora/llama3_lora_sft.yaml 从节点运行使用此方式需要在每台机器上分别运行指令,同时每台机器上都需要安装LLaMA-Factory和相同的conda环境,都需要保存一份要训练的模型文件。参考yamlmodelmodel_name_or_path: Qwen/Qwen3-8B-Base # 更新为 本地路径(否则回去社区下载)methodstage: sftdo_train: truefinetuning_type: loralora_target: q_proj,v_proj # 可保留,也可扩展为更多模块(见下方建议)lora_rank: 64 # 推荐设置,LoRA 秩lora_dropout: 0.05 # 可选:增加轻微 dropout 提升泛化lora_alpha: 16 # 缩放参数,一般设为 r 的倍数ddpddp_timeout: 180000000deepspeed: examples/deepspeed/ds_z0_config.json # 根据显卡数量选择合适的 ZeRO 配置datasetdataset: identity,alpaca_en_demo # 示例数据集,可替换为你自己的template: qwen # 注意:Qwen3 支持新的 template 名称,但目前仍可用 qwencutoff_len: 8192 # Qwen3 支持最长 32768,但训练时建议从 8192 起步以节省显存max_samples: 1000overwrite_cache: truepreprocessing_num_workers: 16outputoutput_dir: saves/Qwen3-8B/lora/sft # 输出路径更新logging_steps: 10save_steps: 500eval_steps: 500plot_loss: trueoverwrite_output_dir: truetrainper_device_train_batch_size: 1 # 根据 GPU 显存调整(如 A100 80G 可尝试 2)gradient_accumulation_steps: 4 # 增大以补偿小 batch size,提升有效 batchlearning_rate: 2e-5 # 推荐 LoRA 学习率范围 1e-5 ~ 5e-5num_train_epochs: 3.0lr_scheduler_type: cosinewarmup_ratio: 0.1fp16: true # 如果使用 bf16,请确保硬件支持并改用 bf16: trueevalval_size: 0.1per_device_eval_batch_size: 1eval_strategy: stepseval_on_train: false # 是否在训练集上也评估(可选)additionalreport_to: tensorboard # 或 wandb,用于可视化监控seed: 42
  • [热门活动] AI在医疗健康中所应用到的场景
    AI不仅能诊断疾病,还能根据每个患者的基因、病史等数据,提供个性化的治疗方案。这个过程让治疗更精准,效果更显著,逐步实现“量体裁衣”的医疗服务。例如,一些健康APP结合患者的饮食、运动数据,生成定制化的健康管理方案,帮助患者更好地管理自己的健康。在生活中你有应用到吗?
  • [技术干货] 【浅谈】什么是流匹配机制 (Flow Matching)
    它是一种非常前沿且强大的生成模型范式,可以被看作是扩散模型在数学上的一个优雅的推广和简化。为了让你直观地理解,我们先从一个比喻开始:核心直觉:河流的比喻想象你要把一滴水从源头(比如,一座山上的泉水,代表噪声数据分布)运送到目的地(比如,山下的一个特定村庄,代表真实数据分布)。扩散模型 的做法是:设计一条蜿蜒曲折、充满随机性的“山路”,让水滴一步一步地、随机地跳向下游。这条路很复杂,需要很多步才能到达。流匹配 的做法是:它直接学习整个河流的水流方向。一旦知道了这条“河流矢量场”,水滴只需要顺着水流方向,就能平滑、快速地漂到目的地。1. 它要解决什么问题?在流匹配出现之前,扩散模型是生成式AI的主流。但扩散模型有一些痛点:采样速度慢:需要很多步(比如1000步)迭代去噪才能生成一张好图片。复杂的损失函数:其训练目标(预测噪声)虽然是有效的,但从概率建模的角度看有些间接和复杂。流匹配的目标就是直接学习一个从简单分布(如高斯噪声)到复杂数据分布(如真实图片)的确定性、平滑的转换路径。2. 流匹配的核心思想流匹配的核心是学习一个矢量场。这个矢量场定义了在每一个点、每一个时刻,数据应该如何移动。我们来分解一下它的关键组成部分,其整体框架和与其他模型的对比可以用下图清晰地展示: 关键概念 1:概率路径我们有一个简单的初始分布 p0(x)p0​(x)(例如高斯噪声)。我们有一个复杂的目标数据分布 p1(x)p1​(x)(例如猫的图片分布)。一个概率路径 pt(x)pt​(x) 是一系列在时间 t∈[0,1]t∈[0,1] 上的分布,它平滑地从 p0p0​ 过渡到 p1p1​。在 t=0t=0 时,是纯噪声;在 t=1t=1 时,是真实数据。关键概念 2:流与矢量场这个概率路径 pt(x)pt​(x) 是由一个矢量场 ut(x)ut​(x) 所“生成”的。你可以把 ut(x)ut​(x) 想象成在时间 tt、空间位置 xx 上的一個速度向量,它指示了数据点应该朝哪个方向、以多快的速度移动。如果我们有一个完美的矢量场,那么一个数据点 xtxt​ 的运动就可以由一个常微分方程 来描述:ddtx(t)=ut(x(t))dtd​x(t)=ut​(x(t))从噪声生成数据:只要从 p0p0​ 采样一个噪声 x0x0​,然后沿着这个ODE积分从 t=0t=0 到 t=1t=1,就能得到一张真实的图片 x1x1​。从数据变为噪声:反过来,从一张真实图片 x1x1​ 出发,沿着这个ODE反向积分(从 t=1t=1 到 t=0t=0),就能得到噪声 x0x0​。3. 流匹配的训练过程现在的问题是:我们并不知道这个完美的矢量场 ut(x)ut​(x) 是什么。流匹配的目标就是训练一个神经网络 vθ(x,t)vθ​(x,t) 来逼近这个真实的矢量场 ut(x)ut​(x)。那么,如何为神经网络设定训练目标呢?这里有一个非常巧妙的构造:构造一个简单的目标矢量场:对于数据集中的每一个真实数据样本 x1x1​,我们都可以人为地设计一条从噪声 x0x0​ 到 x1x1​ 的简单、确定的路径。最直接的就是直线路径:xt=(1−t)⋅x0+t⋅x1xt​=(1−t)⋅x0​+t⋅x1​这条路径的导数(即速度)是:ddtxt=x1−x0dtd​xt​=x1​−x0​对于这个给定的样本对 (x0,x1)(x0​,x1​),我们知道了在路径 xtxt​ 这个点上,“正确的”移动方向应该是 (x1−x0)(x1​−x0​)。我们把它记为这个样本的目标矢量场。训练神经网络去匹配:我们的神经网络 vθ(x,t)vθ​(x,t) 的目标就是,在任意点 xtxt​ 和任意时间 tt,它的输出都应该尽可能接近我们人为设定的目标方向 (x1−x0)(x1​−x0​)。因此,流匹配的损失函数非常简单直观:L(θ)=Et,p1(x1),p0(x0)[∥vθ(xt,t)−(x1−x0)∥2]L(θ)=Et,p1​(x1​),p0​(x0​)​[∥vθ​(xt​,t)−(x1​−x0​)∥2]tt 在 [0,1] 之间均匀采样。x1x1​ 从真实数据分布中采样(一张真实图片)。x0x0​ 从噪声分布中采样(一个随机噪声)。xtxt​ 是根据直线路径 (1−t)x0+tx1(1−t)x0​+tx1​ 计算得到的中间点。训练完成之后,我们就得到了一个训练好的神经网络 vθ(x,t)vθ​(x,t),它可以近似真实的矢量场。在生成新样本时,只需从噪声分布采样一个 x0x0​,然后求解 ODE ddtx(t)=vθ(x(t),t)dtd​x(t)=vθ​(x(t),t) 即可。4. 流匹配 vs. 扩散模型  特性扩散模型流匹配理论基础基于随机微分方程,涉及概率性的前向和反向过程。基于常微分方程,是确定性的流动。训练目标预测在特定时间步添加到数据上的噪声。预测数据点应该移动的方向矢量。采样过程通常需要多步迭代去噪,步骤较多。可以通过高效的ODE求解器,用更少的步数(甚至一步)完成采样。路径通常是非线性的、概率性的路径。通常是线性的、确定性的路径(在CFM中)。关系流匹配是扩散模型的一个超集。实际上,扩散模型可以被证明是流匹配的一种特殊形式。连续流匹配 是当前最先进的方法之一,它统一并简化了扩散模型。总结流匹配机制 提供了一种更统一、更简洁的视角来看待生成模型。它通过直接学习一个驱动数据从噪声分布流向真实数据分布的矢量场,避免了扩散模型中一些复杂的概率计算。其最大的优势在于:训练目标更简单:一个简单的均方误差损失。采样效率更高:通常可以用比扩散模型少得多的步骤生成高质量样本。正因为这些优点,流匹配(尤其是其具体实现如Rectified Flow和Consistency Models)已经成为生成式AI领域最具潜力的方向之一,有望在未来取代传统的扩散模型。
  • 【浅谈】什么是VLM
    VLM 指的是 视觉语言模型。它是一种人工智能模型,能够同时理解和处理视觉信息(如图像、视频)和文本信息,并在两者之间建立深度的联系。简单来说,VLM 让计算机拥有了 “看图说话” 和 “听描述找图” 的能力。它不仅仅是识别物体,更是要理解图像中的场景、上下文、关系,并用人类语言进行交流。一个生动的比喻你可以把 VLM 想象成一个 既失明又失明的人 与一个 正常的、有见识的人 之间的区别:纯语言模型:像一个博闻强识的盲人学者。他读过万卷书(文本数据),知道“猫”这个词代表一种有毛、会喵喵叫的动物,也知道“沙发”是家具。但当你给他看一张猫在沙发上的照片时,他完全无法理解。视觉语言模型:则是一个视力正常、见识广博的人。他不仅能和你谈论猫和沙发,还能看着照片告诉你:“看,一只橘色的猫正蜷在红色的沙发上睡觉呢。” 他能够将看到的视觉景象与掌握的语言知识无缝连接起来。VLM 是如何工作的?VLM 的架构通常包含三个核心部分,其工作流程可以清晰地表示为下图: 下面我们来详解这三个核心组件:视觉编码器作用:充当模型的“眼睛”。负责将输入的图像(像素)转换为一组计算机能够理解的、结构化的数学表示(特征向量)。常用技术:通常使用在大型图像数据集上预训练好的模型,如 ViT 或 CLIP 模型中的视觉部分。CLIP 尤其重要,因为它通过海量“图像-文本对”训练,已经学会了将语义相似的图像和文本在特征空间中对齐。大语言模型作用:充当模型的“大脑”。负责处理文本、进行逻辑推理、并生成自然语言的回复。常用模型:强大的开源或闭源 LLM,如 LLaMA、GPT、PaLM 等。它提供了强大的语言理解和生成能力。融合模块作用:这是 VLM 的灵魂,也是最关键的部分。它负责将视觉编码器输出的“视觉语言”和文本的“人类语言”进行对齐和融合。工作原理:融合模块(可能是一个简单的投影层,或更复杂的交叉注意力机制、Q-Former 等)将视觉特征向量进行转换,并将其作为一系列特殊的“视觉提示”或“伪文本令牌”输入给 LLM。最终效果:LLM 将这些视觉提示与文本指令一起处理,就像在处理一段特殊的“文字”一样,从而能够根据视觉信息来生成相关的回答。VLM 能做什么?(应用场景)VLM 的能力非常广泛,主要包括:视觉问答:给定一张图片和一个问题,模型能给出答案。图:一个男人在湖邊钓鱼。问:“他在做什么?”答:“他正在钓鱼。”图像描述:为给定的图像生成一段文字描述。图:一个混乱的房间。描述:“房间里衣服散落一地,书桌上堆满了书本和文具,床上的被子也没有叠。”视觉推理:基于图像进行逻辑推理。图:一个人穿着短袖站在户外,树木光秃秃的。问:“可能是什么季节?”答:“可能是冬季,因为树叶都掉光了,虽然这个人穿着短袖,但这可能是个例外。”基于图像的文本生成:根据图片内容创作故事、诗歌等。文档理解:从表格、图表、发票等文档图片中提取和总结信息。多模态聊天机器人:像 GPT-4V 一样,用户可以随时发送图片并与AI进行关于图片的对话。代表性的 VLM 模型GPT-4V:OpenAI 发布的里程碑式多模态模型,能力非常全面。LLaVA:一个开源领域的佼佼者,将视觉编码器与 LLaMA 语言模型连接起来,效果出色。BLIP-2:提出了高效的融合模块 Q-Former,在减少计算成本的同时实现了强大的性能。Gemini:Google 推出的原生多模态模型,从设计之初就为处理文本、图像、视频等多种信息而构建。
  • [技术干货] 【浅谈】扩散模型为什么能生成机器人动作
    扩散模型之所以能成功地应用于机器人动作生成,是因为它们从根本上改变了动作规划和策略学习的范式:从传统的“搜索/优化一个最优解”转变为“从噪声中迭代地雕琢出一个高质量的动作序列”。下面我们通过对比传统方法、核心原理以及扩散模型的具体优势来详细解释。1. 与传统方法的对比首先,理解传统方法的瓶颈,才能明白扩散模型的突破性。传统方法(如优化、MPC、经典RL):思想:从一个初始猜测开始,通过梯度下降或采样,局部地寻找一个能最大化奖励(或最小化成本)的动作序列。瓶颈:容易陷入局部最优。比如,机器人要绕过障碍物拿东西,传统方法可能卡在“直接撞向障碍物”这个局部解里,无法找到“先绕行再拿取”的全局更优解。它们缺乏“想象力”来跳出当前的思维框架。扩散模型方法:思想:从一个完全随机的、无意义的动作序列(噪声)开始,逐步地、迭代地对其“去噪”,最终使其收敛为一个合理、平滑且能完成任务的动作序列。优势:这个从噪声开始的过程,本质上是在对整个动作空间进行全局探索。它允许模型在早期迭代中考虑多种可能性,然后在后期逐渐聚焦到最优解上。2. 核心原理:如何将动作生成转化为去噪过程扩散模型用于机器人动作生成的流程,可以清晰地划分为训练和推理两个阶段,其核心数据流如下图所示: 阶段一:训练 —— 学习“好的动作”是什么样的数据准备:收集专家演示数据,即机器人在不同任务下成功执行的动作序列 τ=(a1,a2,...,aT)τ=(a1​,a2​,...,aT​),其中 atat​ 可以是在时间t的关节角度、末端执行器速度等。加噪:随机选取一个专家动作序列 τ0τ0​,然后逐步向其添加高斯噪声,经过多步后,它变成完全随机的噪声 τTτT​。模型学习:训练一个神经网络(通常是U-Net或Transformer),输入是带噪声的动作序列 τtτt​、当前噪声步数 tt 和任务条件 cc(例如目标图像“把杯子放到桌上”),让模型预测出所添加的噪声 εε。本质:模型在学习“一个好的动作序列,在被噪声干扰后,应该如何被恢复”的逆过程。它潜在地学习了动作的动力学约束(如何平滑移动)、任务逻辑和物理规律。阶段二:推理/规划 —— 从噪声中“雕琢”动作初始化:从一个完全随机的动作序列 τTτT​(纯噪声)开始。迭代去噪:对于 t=T,T−1,...,1t=T,T−1,...,1:a. 将当前噪声动作 τtτt​ 和任务条件 cc 输入训练好的扩散模型。b. 模型预测出噪声 εθεθ​。c. 根据特定的采样器(如DDPM, DDIM),从 τtτt​ 中部分地移除预测的噪声,得到一个更干净的序列 τt−1τt−1​。这个过程的每一步都在提升动作序列的质量,使其从随机乱动,逐渐变得平滑、合理,并最终能完成任务。执行与重规划:机器人执行生成的动作序列 τ0τ0​。在闭环控制中,机器人只执行第一步或前几步,然后根据新的传感器观测,重新进行从噪声开始的整个去噪规划,以适应环境变化。3. 扩散模型的独特优势为什么这种方法如此有效?多模态建模能力:对于一个任务(如“拿水杯”),可能存在多种不同的成功策略(快、慢、从左、从右)。扩散模型从噪声开始采样的特性,使其能自然地生成多种多样的解决方案,而不是只有一个。表达能力强且稳定:相比早期的生成模型(如GANs),扩散模型训练更稳定,能捕捉非常复杂的数据分布(即各种复杂的机器人技能)。易于融入约束:在去噪过程的每一步,我们都可以注入额外的信息来引导生成方向:奖励函数:像引导式扩散一样,根据奖励分数调整去噪方向。物理约束:如果预测的动作会导致碰撞,可以在该步骤将其“拉回”到安全区域。任务描述:通过条件 cc 精确控制要完成的任务。从失败中恢复:由于每一步都带有随机性,即使某次规划走向了死胡同(例如快要撞上了),下一次从噪声开始的重新规划可能会找到一个完全不同的、成功的路径。总结比喻你可以将扩散模型生成机器人动作理解为:一个“创意规划师”在头脑风暴。他首先进行发散性思考,产生大量天马行空、甚至荒谬的想法(从噪声开始)。然后他根据目标和规则(任务条件 cc),一次次地审视和修正这些想法,剔除掉不合理的部分(迭代去噪)。经过多轮迭代,一个清晰、可行、且富有创意的最终方案(动作序列 τ0τ0​)诞生了。这种方法让机器人不再只是简单地“计算”出一个动作,而是通过一个创造性的、全局搜索的迭代过程,“构想”出最优行为,从而解决了传统方法在复杂、多模态任务中容易陷入局部最优的难题。这无疑是机器人决策智能领域一个非常有力的突破。
  • [技术干货] 【浅谈】逆向去噪训练的具体过程是什么?
    逆向去噪训练是扩散模型(包括去噪扩散概率模型 DDPM 和噪声条件评分网络 NCSN)的核心思想。为了清晰地解释,我们以最经典的 DDPM 为例,详细拆解其训练过程。其核心思想可以概括为一句话:训练一个神经网络,去预测在正向过程中添加到数据上的噪声。核心直觉想象一下教一个盲人修复一张被雨滴(噪声)打湿的照片。你一次次地向他展示同一张照片被不同程度雨滴打湿的样子,并告诉他:“看,这是原图加了这些雨滴后的结果。” 经过足够多的训练,这个盲人就能学会通过观察一张被雨滴打湿的图片,来推断出原本的雨滴是什么,从而将其去除。扩散模型的训练就是这个过程的自动化、数学化版本。具体训练过程分解第一阶段:前向过程(加噪过程)前向过程是一个固定的、预先定义好的过程,不包含任何可学习的参数。它的作用就是系统地破坏训练数据。数据准备:我们有一个来自真实数据分布 x0∼q(x)x0​∼q(x) 的样本,比如一张清晰的图片 x0x0​。定义噪声调度:我们预先定义一组超参数 β1,β2,...,βTβ1​,β2​,...,βT​(0<βt<10<βt​<1),它们随着步数 tt 通常线性或余弦增加。这决定了每一步添加噪声的多少。逐步加噪:从 t=1t=1 到 t=Tt=T(例如 T=1000),我们逐步向数据中添加高斯噪声。每一步的数学形式是:xt=1−βt⋅xt−1+βt⋅ϵxt​=1−βt​​⋅xt−1​+βt​​⋅ϵ其中 ϵ∼N(0,I)ϵ∼N(0,I) 是标准高斯噪声。这个公式的巧妙之处在于,我们可以通过一次计算,直接从原始图像 x0x0​ 得到任何一步 tt 的噪声图像 xtxt​:xt=αˉt⋅x0+1−αˉt⋅ϵxt​=αˉt​​⋅x0​+1−αˉt​​⋅ϵ其中 αt=1−βtαt​=1−βt​,αˉt=∏s=1tαsαˉt​=∏s=1t​αs​。这使得训练过程可以非常高效地进行随机采样。最终,当 t=Tt=T 时,xTxT​ 几乎完全变成了一个各向同性的高斯噪声,没有任何原始数据的结构。第二阶段:逆向过程(去噪模型训练)这才是真正的“训练”部分。我们的目标是学习一个神经网络(通常是 U-Net),它能够逆转上述的前向过程。训练目标设定:输入:我们随机选择一个训练样本 x0x0​,一个随机的时间步 t∼Uniform(1,T)t∼Uniform(1,T),并采样一个随机噪声 ϵ∼N(0,I)ϵ∼N(0,I)。构造输入数据:我们利用前向过程的公式,直接计算出 tt 时刻的噪声图像 xt=αˉt⋅x0+1−αˉt⋅ϵxt​=αˉt​​⋅x0​+1−αˉt​​⋅ϵ。神经网络的任务:我们将 xtxt​ 和 tt 一起输入神经网络 ϵθϵθ​(参数为 θθ),并要求它预测出我们之前加入的噪声 ϵϵ。输入:噪声图像 xtxt​,时间步 tt(通常通过位置编码嵌入)。期望输出:噪声 ϵϵ。损失函数:训练的目标是最小化预测噪声和真实噪声之间的差距。这通常用一个简单的均方误差损失函数:L(θ)=Et,x0,ϵ[∥ϵ−ϵθ(xt,t)∥2]L(θ)=Et,x0​,ϵ​[∥ϵ−ϵθ​(xt​,t)∥2]这个损失函数非常简洁,它直接衡量了预测的噪声和真实加入的噪声之间的差异。训练循环:从训练集中取一个 batch 的真实数据 x0x0​。随机采样对应的时间步 tt 和噪声 ϵϵ。计算 xtxt​。将 (xt,t)(xt​,t) 输入网络 ϵθϵθ​,得到预测的噪声 ϵθ(xt,t)ϵθ​(xt​,t)。计算损失 ∥ϵ−ϵθ(xt,t)∥2∥ϵ−ϵθ​(xt​,t)∥2。通过反向传播更新网络参数 θθ。重复以上步骤直至收敛。一个生动的比喻:教学与考试前向过程(教师准备考题):教师拿一张清晰的照片(x0x0​),按照一个固定的规则(噪声调度表),逐步地用墨水(噪声 ϵϵ)覆盖它,得到一张几乎全黑的图片(xTxT​)。同时,教师记录下每一步使用的墨水(噪声 ϵϵ)。逆向训练(学生练习):教师从题库中随机抽一张原图 x0x0​,随机选择一个难度级别 tt,然后根据规则把它涂到 xtxt​ 的状态。教师把这张被部分涂黑的图片 xtxt​ 和难度级别 tt 给学生看,问他:“你猜我用了哪种墨水 ϵϵ 来涂的?”学生(神经网络 ϵθϵθ​)根据图片和难度,给出他的答案 ϵθ(xt,t)ϵθ​(xt​,t)。教师对比学生猜测的墨水和实际使用的墨水 ϵϵ 的差异(计算损失),并纠正学生(反向传播更新参数)。经过海量这样的练习,学生就学会了如何根据任何一张被涂黑的图片和它的涂黑程度,精确地反推出所使用的墨水。训练完成后如何生成新样本?(推理/采样过程)训练完成后,我们得到了一个训练好的噪声预测器 ϵθϵθ​。生成新图片的过程就是从纯噪声 xT∼N(0,I)xT​∼N(0,I) 开始,逐步去噪:从 xTxT​ 开始。对于 t=T,T−1,...,1t=T,T−1,...,1:a. 使用网络预测噪声:ϵθ(xt,t)ϵθ​(xt​,t)。b. 利用预测的噪声,根据一个采样器(如 DDPM 或 DDIM 的更新规则)计算出去噪一步后的图像 xt−1xt−1​。xt−1=1αt(xt−1−αt1−αˉtϵθ(xt,t))+σtzxt−1​=αt​​1​(xt​−1−αˉt​​1−αt​​ϵθ​(xt​,t))+σt​z(其中 zz 是额外的随机噪声,在 DDIM 等采样器中可以为零)最终,x0x0​ 就是生成的新图像。总结逆向去噪训练的本质是:通过一个固定的前向过程(加噪)来构造训练数据对 (xt,t,ϵ)(xt​,t,ϵ),然后训练一个模型去学习这个加噪过程的逆过程。其学习目标是直接预测出所添加的噪声,而不是直接预测去噪后的图像本身。 这种方法被证明非常有效且稳定,是当今生成式 AI 爆发的重要基石之一。
  • [技术干货] 【浅谈】ACT、SmolVLA、Pi0各有什么优势?
    ACT、SmolVLA 和 Pi0 代表了当前在高效多模态人工智能模型方面的不同设计哲学和优化路径。首先,需要澄清一个可能存在的混淆:ACT 和 SmolVLA/Pi0 并非完全同一纬度的概念。ACT 是一个具体的、已发布的模型名称。SmolVLA 和 Pi0 更像是一类模型架构设计思想或项目名称,它们阐述了如何构建高效VLM的核心原则。下面我将详细解析它们各自的特点和优势。1. ACT: Adaptive Computation Time for Vision-Language ModelsACT并非一个独立模型,而是微软发布的一个大型多模态模型,其全称是ACT-1:Simulating Human Computer Interactions。它的核心创新点在于将“强化学习” 与“大语言模型” 相结合,用于模拟人类与计算机的交互行为。核心优势:学会“操作”,而非仅仅“描述”:传统VLM(如GPT-4V)在看到UI界面后,可以描述它是什么,但无法实际操作。ACT经过训练后,能够理解用户的自然语言指令(如“帮我把这个文档保存为PDF”),并生成一系列操作指令(如 click(id=save_button), select_dropdown(option=pdf))来实际完成这个任务。它模拟的是一个数字助手。自适应推理与规划能力:名字中的“Adaptive Computation”体现了它的能力。面对复杂任务,ACT不会一次性给出所有操作,而是会进行多步推理和规划,根据上一步操作的结果决定下一步做什么,这更接近人类的交互方式。将VLM作为世界模型:ACT将图形用户界面(GUI)视为一个“世界”,VLM作为理解这个世界的“眼睛和大脑”。它标志着VLM从被动的内容理解走向了主动的环境交互,是通向具身智能在数字世界中的重要一步。简而言之,ACT的优势在于其开创性的任务导向和交互能力,它拓展了VLM的应用边界,从“看和说”升级到了“看、想和做”。2. SmolVLA: The “Small” Vision-Language ModelSmolVLA 是由AI研究员 Andrei Karpathy 提出的一种轻量级、高效、可从头训练的VLM架构设计。其名字“Smol”即“Small”的趣称,旨在对抗当前模型越来越大的趋势。核心优势:极致的简洁与统一:它摒弃了传统VLM中复杂的“视觉编码器-融合器-LLM”三板斧结构。它使用一个纯Decoder-Only的Transformer,同时处理图像和文本。图像被切分成小块(patches)后,经过一个简单的投影层,就直接和文本token拼接在一起,送入同一个Transformer。架构上非常干净,几乎没有多余的模块。可从头训练:像BLIP-2、LLaVA等模型严重依赖预训练好的、冻结的视觉编码器(如CLIP)和预训练好的、冻结的LLM。SmolVLA 的设计目标就是不使用任何预训练权重,让图像和文本从一开始就在一个统一的模型中进行联合训练。这使得模型内部的视觉和语言表征能够达到最优对齐,避免了预训练模型之间的“语义隔阂”。高性能与低成本:尽管模型小,但由于其统一和简洁的设计,它在一些基准测试上可以达到甚至超过参数量大得多的模型(如LLaVA-1.5 7B),同时训练和推理成本显著降低。简而言之,SmolVLA的优势在于其架构的优雅、训练的自洽性和极低的成本,它证明了“小模型”通过精良的设计同样可以拥有强大的能力。3. Pi0: The “Pi” or “Pioneer” FamilyPi0 是来自 Google 的 DeepMind 团队推出的一系列高效模型,包括语言模型 Pi0-lang 和多模态模型 Pi0-vision。它的核心思想是 “强化学习驱动的模型优化”。核心优势:由强化学习“设计”的模型:这是Pi0最革命性的特点。传统模型架构和训练流程都是由人类专家设计的。Pi0则不同,它使用一个强大的“教师模型”(如GPT-4)通过强化学习来直接指导和优化一个小的“学生模型”(Pi0)的内部决策过程。不仅仅是优化输出,还可能优化中间层的激活值或注意力模式。超越蒸馏的深度指导:传统的知识蒸馏只是让学生模型模仿老师模型的最终输出。Pi0的RL引导更为深入,它旨在让学生模型学会老师模型的“推理思路”。这使得小模型能在复杂任务上展现出远超其参数规模的推理能力。在代码和数学推理上表现卓越:Pi0-lang 在HumanEval(代码生成)和MATH(数学问题)等需要强推理能力的基准测试上,性能远超同规模的传统模型,甚至可以媲美大一个数量级的模型。简而言之,Pi0的优势在于其开创性的训练方法论。它利用RL和大模型(教师)的智慧,从内部“雕琢”出一个小而精的模型,实现了“四两拨千斤”的效果。总结与对比  特性/项目ACTSmolVLAPi0核心创新点交互代理统一简洁架构RL驱动的优化主要优势能将视觉理解转化为具体操作,实现数字世界交互。架构干净、成本低、可从头训练,视觉语言表征对齐好。小模型具备强推理能力,在代码、数学上表现惊人。应用场景自动化软件操作、数字助手、RPA。轻量级多模态应用、嵌入式设备、学术研究。需要强逻辑推理的轻量级应用,如代码助手、数学解题。比喻数字世界的“机器人”精心设计的“经济型轿车”得到大师真传的“天才少年”关系总结:这三者代表了不同的发展方向:SmolVLA 和 Pi0 在解决如何让模型更小、更高效的问题上提出了两种截然不同但同样精彩的答案:SmolVLA从架构设计入手,而Pi0从训练方法入手。ACT 则是在思考模型能做什么,它探索了VLM的一个全新应用范式——交互代理,这个范式完全可以建立在SmolVLA或Pi0这样的高效模型之上。
总条数:7838 到第
上滑加载中