- 导言在前两篇文章中,我分别讨论了通用Agent的认知架构(《高认知的本质,基于真实信息的规则推演》)和垂直Agent的构建方法论(《垂直Agent的设计方法论》)。本文延续这一脉络,聚焦一个更具体的问题:当我们用语言模型进行辅助决策分析时,如何判断它的输出是可靠的?一个常见的做法是让模型多跑几次,如果几次结果一致,就认为可靠。这个方法在学术界被称为"自一致性"(Self-Consisten... 导言在前两篇文章中,我分别讨论了通用Agent的认知架构(《高认知的本质,基于真实信息的规则推演》)和垂直Agent的构建方法论(《垂直Agent的设计方法论》)。本文延续这一脉络,聚焦一个更具体的问题:当我们用语言模型进行辅助决策分析时,如何判断它的输出是可靠的?一个常见的做法是让模型多跑几次,如果几次结果一致,就认为可靠。这个方法在学术界被称为"自一致性"(Self-Consisten...
- 核心概念:点、面、Agent点: 用户需求中具有明确指向性的内容——用户明确要求的、记忆体现的、持续追求的目标。每个点都带有向外的延展势能。面: 一个点向相邻知识域延展所形成的知识网络。面具有内部一致性(面内的知识相互支撑)和边界(面在何处停止)。学术体系: 多个学科面的组织结构化描述——每个学科域包含该领域的规则库、推演模式和边界条件。Agent: 多个面在同一点集上的收敛。一个Agen... 核心概念:点、面、Agent点: 用户需求中具有明确指向性的内容——用户明确要求的、记忆体现的、持续追求的目标。每个点都带有向外的延展势能。面: 一个点向相邻知识域延展所形成的知识网络。面具有内部一致性(面内的知识相互支撑)和边界(面在何处停止)。学术体系: 多个学科面的组织结构化描述——每个学科域包含该领域的规则库、推演模式和边界条件。Agent: 多个面在同一点集上的收敛。一个Agen...
- 本文讨论的Agent设计规范,预设的场景是:开放域、多规则交叉、高风险的通用认知Agent。如果你的Agent只需在一个封闭域中完成简单任务(如单一API的调用封装、固定模板的文本生成),部分规范可能过于严格。但如果你要求Agent具备在复杂环境下独立做判断、跨域推理、结论需被外部信任的能力——以下框架不做妥协。 引言认知这个词被用滥了。它被等同于"知道得多"、“能讲出道理”、“有深度思考的... 本文讨论的Agent设计规范,预设的场景是:开放域、多规则交叉、高风险的通用认知Agent。如果你的Agent只需在一个封闭域中完成简单任务(如单一API的调用封装、固定模板的文本生成),部分规范可能过于严格。但如果你要求Agent具备在复杂环境下独立做判断、跨域推理、结论需被外部信任的能力——以下框架不做妥协。 引言认知这个词被用滥了。它被等同于"知道得多"、“能讲出道理”、“有深度思考的...
- 一、实验目标验证以下假设:在中场操作化层注入结构化规则库 + 蒙版激活梯度 + 请求灌注机制后,Agent在合规审查任务上的检出率、可追溯性和置信度诚实性显著优于原生RAG+LLM方案。 二、实验场景与模拟数据 2.1 背景星途科技(虚构),一家为企业客户提供会员管理SaaS的中型公司,服务约80家企业客户,覆盖零售、餐饮、美业三个行业。公司正在委托外部数据分析公司数联科技进行客户画像建模... 一、实验目标验证以下假设:在中场操作化层注入结构化规则库 + 蒙版激活梯度 + 请求灌注机制后,Agent在合规审查任务上的检出率、可追溯性和置信度诚实性显著优于原生RAG+LLM方案。 二、实验场景与模拟数据 2.1 背景星途科技(虚构),一家为企业客户提供会员管理SaaS的中型公司,服务约80家企业客户,覆盖零售、餐饮、美业三个行业。公司正在委托外部数据分析公司数联科技进行客户画像建模...
- Litefuse 正式开源,并推出轻量的单机单进程版本。开发者只需一行命令,即可在约 25 秒内完成 Litefuse 的下载、安装和部署,快速搭建 Agent 可观测、Trace 分析与效果评估平台。curl -fsSL https://litefuse.ai/install.sh | sh在前一篇文章《Litefuse 正式发布:Agent 可观测与效果评估,比 Langfuse 成本低... Litefuse 正式开源,并推出轻量的单机单进程版本。开发者只需一行命令,即可在约 25 秒内完成 Litefuse 的下载、安装和部署,快速搭建 Agent 可观测、Trace 分析与效果评估平台。curl -fsSL https://litefuse.ai/install.sh | sh在前一篇文章《Litefuse 正式发布:Agent 可观测与效果评估,比 Langfuse 成本低...
- java工具:《json字符串转JSONObject》 java工具:《json字符串转JSONObject》
- promptfoo 的价值不只是给 LLM 输出打分,而是把 prompt、RAG、agent 的失败边界、工具调用和红队用例变成可重复执行的发布前检查。 promptfoo 的价值不只是给 LLM 输出打分,而是把 prompt、RAG、agent 的失败边界、工具调用和红队用例变成可重复执行的发布前检查。
- 很多开发者在使用 xAI 的 Grok 模型写代码时,常被它那“放荡不羁”的幽默感和极简(甚至有些偷懒)的编码风格折腾得头疼。作为一款主打个性的模型,Grok 在快速实现 Demo 上表现惊艳,但直接用于企业级项目时,往往缺乏严格的类型约束和异常处理。为了解决这一痛点,不少开发者选择在AI模型聚合平台——工具整合站点库拉上,通过多模型同屏对比和精细化 Prompt 调教,成功让 Grok 输... 很多开发者在使用 xAI 的 Grok 模型写代码时,常被它那“放荡不羁”的幽默感和极简(甚至有些偷懒)的编码风格折腾得头疼。作为一款主打个性的模型,Grok 在快速实现 Demo 上表现惊艳,但直接用于企业级项目时,往往缺乏严格的类型约束和异常处理。为了解决这一痛点,不少开发者选择在AI模型聚合平台——工具整合站点库拉上,通过多模型同屏对比和精细化 Prompt 调教,成功让 Grok 输...
- 给 AI Agent 接入记忆层之前,先区分短期上下文、长期事实和推理轨迹,并用最小 dry run 验证写入、检索、纠错和删除边界。 给 AI Agent 接入记忆层之前,先区分短期上下文、长期事实和推理轨迹,并用最小 dry run 验证写入、检索、纠错和删除边界。
- 在软件研发流程中,系统架构评审(Architecture Review)往往是最耗费资深架构师精力的环节。一个高并发、分布式的系统方案,需要同时从可靠性、扩展性、安全性和成本等多个维度进行严苛审视。最近,笔者在工具整合站点库拉这一AI模型聚合平台上,尝试利用 Grok 2 与 Gemini 1.5 Pro 进行“多模型同屏评审”。通过将不同擅长领域的 AI 模型组合使用,不仅能快速揪出设计方... 在软件研发流程中,系统架构评审(Architecture Review)往往是最耗费资深架构师精力的环节。一个高并发、分布式的系统方案,需要同时从可靠性、扩展性、安全性和成本等多个维度进行严苛审视。最近,笔者在工具整合站点库拉这一AI模型聚合平台上,尝试利用 Grok 2 与 Gemini 1.5 Pro 进行“多模型同屏评审”。通过将不同擅长领域的 AI 模型组合使用,不仅能快速揪出设计方...
- 大模型普遍采用8192维度的隐藏层设计并非偶然,而是多重因素综合优化的结果。这一维度设计在Transformer架构中实现了数学规律与硬件特性的完美平衡:首先,8192作为2的幂次数(2^13),天然适配GPU的二进制运算架构,能最大化利用TensorCore的计算效率;其次,该维度能整除128个注意力头(每个头64维),确保多头注意力机制的高效并行计算;同时,8192维度配合4倍扩缩的前馈网络设 大模型普遍采用8192维度的隐藏层设计并非偶然,而是多重因素综合优化的结果。这一维度设计在Transformer架构中实现了数学规律与硬件特性的完美平衡:首先,8192作为2的幂次数(2^13),天然适配GPU的二进制运算架构,能最大化利用TensorCore的计算效率;其次,该维度能整除128个注意力头(每个头64维),确保多头注意力机制的高效并行计算;同时,8192维度配合4倍扩缩的前馈网络设
- 离线VSCode对接本地大模型:单文件对话界面实现(持久化+文件图片上传) 前言最近在处理离线内网环境下的VSCode开发需求,场景很明确:没有外网,没法安装GitHub Copilot之类的在线AI插件;本地已经部署好了大模型API(无论是Ollama、vLLM还是私有化部署的模型服务),想在VSCode的开发工作流里直接做代码问答、本地文档分析,不想切换厚重的独立客户端,也不想折腾复杂... 离线VSCode对接本地大模型:单文件对话界面实现(持久化+文件图片上传) 前言最近在处理离线内网环境下的VSCode开发需求,场景很明确:没有外网,没法安装GitHub Copilot之类的在线AI插件;本地已经部署好了大模型API(无论是Ollama、vLLM还是私有化部署的模型服务),想在VSCode的开发工作流里直接做代码问答、本地文档分析,不想切换厚重的独立客户端,也不想折腾复杂...
- 前面的文章依次介绍了如何截断历史会话的对话记录,包括按照记录数量截断、按照Token长度截断,以及浓缩为摘要截断等等,其中摘要操作又分为三大类:1、使用第三方的摘要库对文本摘要;2、使用在线大模型对文本摘要;3、使用离线大模型对文本摘要;以上对会话记录的各种处理操作,统称为AI应用的上下文管理,即让AI理解用户之前的意图。接下来将开启有关RAG部分的AI应用开发教程介绍。一、什么是RAGR... 前面的文章依次介绍了如何截断历史会话的对话记录,包括按照记录数量截断、按照Token长度截断,以及浓缩为摘要截断等等,其中摘要操作又分为三大类:1、使用第三方的摘要库对文本摘要;2、使用在线大模型对文本摘要;3、使用离线大模型对文本摘要;以上对会话记录的各种处理操作,统称为AI应用的上下文管理,即让AI理解用户之前的意图。接下来将开启有关RAG部分的AI应用开发教程介绍。一、什么是RAGR...
- 把 Langfuse 接入 AI Agent 前,先检查 trace、eval、prompt 变更和恢复规则,避免没有证据就信任下一次运行。 把 Langfuse 接入 AI Agent 前,先检查 trace、eval、prompt 变更和恢复规则,避免没有证据就信任下一次运行。
- 团队在 AI 工具使用中积累的 Prompt、Skill 和 Memory 属于重要生产经验,但现有工具链未提供有效的留存机制。本文探讨一种将 AI 经验纳入技术资产管理的工程方案。 团队在 AI 工具使用中积累的 Prompt、Skill 和 Memory 属于重要生产经验,但现有工具链未提供有效的留存机制。本文探讨一种将 AI 经验纳入技术资产管理的工程方案。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签