- 离线VSCode对接本地大模型:单文件对话界面实现(持久化+文件图片上传) 前言最近在处理离线内网环境下的VSCode开发需求,场景很明确:没有外网,没法安装GitHub Copilot之类的在线AI插件;本地已经部署好了大模型API(无论是Ollama、vLLM还是私有化部署的模型服务),想在VSCode的开发工作流里直接做代码问答、本地文档分析,不想切换厚重的独立客户端,也不想折腾复杂... 离线VSCode对接本地大模型:单文件对话界面实现(持久化+文件图片上传) 前言最近在处理离线内网环境下的VSCode开发需求,场景很明确:没有外网,没法安装GitHub Copilot之类的在线AI插件;本地已经部署好了大模型API(无论是Ollama、vLLM还是私有化部署的模型服务),想在VSCode的开发工作流里直接做代码问答、本地文档分析,不想切换厚重的独立客户端,也不想折腾复杂...
- 前面的文章依次介绍了如何截断历史会话的对话记录,包括按照记录数量截断、按照Token长度截断,以及浓缩为摘要截断等等,其中摘要操作又分为三大类:1、使用第三方的摘要库对文本摘要;2、使用在线大模型对文本摘要;3、使用离线大模型对文本摘要;以上对会话记录的各种处理操作,统称为AI应用的上下文管理,即让AI理解用户之前的意图。接下来将开启有关RAG部分的AI应用开发教程介绍。一、什么是RAGR... 前面的文章依次介绍了如何截断历史会话的对话记录,包括按照记录数量截断、按照Token长度截断,以及浓缩为摘要截断等等,其中摘要操作又分为三大类:1、使用第三方的摘要库对文本摘要;2、使用在线大模型对文本摘要;3、使用离线大模型对文本摘要;以上对会话记录的各种处理操作,统称为AI应用的上下文管理,即让AI理解用户之前的意图。接下来将开启有关RAG部分的AI应用开发教程介绍。一、什么是RAGR...
- 把 Langfuse 接入 AI Agent 前,先检查 trace、eval、prompt 变更和恢复规则,避免没有证据就信任下一次运行。 把 Langfuse 接入 AI Agent 前,先检查 trace、eval、prompt 变更和恢复规则,避免没有证据就信任下一次运行。
- 团队在 AI 工具使用中积累的 Prompt、Skill 和 Memory 属于重要生产经验,但现有工具链未提供有效的留存机制。本文探讨一种将 AI 经验纳入技术资产管理的工程方案。 团队在 AI 工具使用中积累的 Prompt、Skill 和 Memory 属于重要生产经验,但现有工具链未提供有效的留存机制。本文探讨一种将 AI 经验纳入技术资产管理的工程方案。
- 这篇文章围绕 Claude 4.8 在接口评审中的实际用法展开,强调先做需求拆解、状态梳理、测试点补充,再进入代码生成。文中还给出安全的 Prompt、伪代码示例、AI 输出验证方法和常见误区,适合开发者在研发流程中低门槛使用多模型工具提升效率。 这篇文章围绕 Claude 4.8 在接口评审中的实际用法展开,强调先做需求拆解、状态梳理、测试点补充,再进入代码生成。文中还给出安全的 Prompt、伪代码示例、AI 输出验证方法和常见误区,适合开发者在研发流程中低门槛使用多模型工具提升效率。
- Anthropic 推实名制引发了对 AI 调用治理的讨论。本文从工程角度拆解企业 API 调用的三层治理模型——身份、归属与行为审计,并提出基于本地代理的轻量治理方案。 Anthropic 推实名制引发了对 AI 调用治理的讨论。本文从工程角度拆解企业 API 调用的三层治理模型——身份、归属与行为审计,并提出基于本地代理的轻量治理方案。
- 我们一起来思考一个问题 我们一起来思考一个问题
- 探讨企业AI调用中产生的Prompt模式、Skill链路和Memory片段的工程化管理路径,分析接入层收口、Runtime采集、资产提纯、目录检索、蒸馏复用五个阶段的架构设计要点。 探讨企业AI调用中产生的Prompt模式、Skill链路和Memory片段的工程化管理路径,分析接入层收口、Runtime采集、资产提纯、目录检索、蒸馏复用五个阶段的架构设计要点。
- 上一篇文章末尾使用了在线大模型压缩文本生成摘要,但该方式会消耗Token,不便初学者长期使用,更好的办法是采用离线大模型来生成文本摘要。一、离线大模型的种类国内常用的离线大模型有阿里Qwen、智谱GLM、深度求索DeepSeek、百度文心等等,以千问的文本大模型为例,又有Qwen1.5-1.8B-Chat和Qwen1.5-0.5B-Chat两种。Qwen1.5是一系列不同大小的解码器语言模... 上一篇文章末尾使用了在线大模型压缩文本生成摘要,但该方式会消耗Token,不便初学者长期使用,更好的办法是采用离线大模型来生成文本摘要。一、离线大模型的种类国内常用的离线大模型有阿里Qwen、智谱GLM、深度求索DeepSeek、百度文心等等,以千问的文本大模型为例,又有Qwen1.5-1.8B-Chat和Qwen1.5-0.5B-Chat两种。Qwen1.5是一系列不同大小的解码器语言模...
- @[TOC](本地离线大模型实战:Ollama + Llama 3.1 8B 全流程部署(适配VSCode Continue代码助手)) 前言之前一直依赖云端AI写代码、整理文案,但一是敏感代码不敢上传公网,二是网络波动经常卡顿。折腾一周,把Llama3.1 8B部署到普通Windows台式机,搭配Ollama一键调度,还打通了VSCode Continue插件实现本地AI编码助手。全程免费... @[TOC](本地离线大模型实战:Ollama + Llama 3.1 8B 全流程部署(适配VSCode Continue代码助手)) 前言之前一直依赖云端AI写代码、整理文案,但一是敏感代码不敢上传公网,二是网络波动经常卡顿。折腾一周,把Llama3.1 8B部署到普通Windows台式机,搭配Ollama一键调度,还打通了VSCode Continue插件实现本地AI编码助手。全程免费...
- 本文聚焦多账号治理痛点,揭示“堆账号”导致的限流、封号与成本浪费问题,提出以虚拟凭证池为核心的API统一管理方案——抽象30个物理Key为1个可控预算池,实现额度分发、策略管控与安全审计,让大模型调用从混乱走向工程化。 本文聚焦多账号治理痛点,揭示“堆账号”导致的限流、封号与成本浪费问题,提出以虚拟凭证池为核心的API统一管理方案——抽象30个物理Key为1个可控预算池,实现额度分发、策略管控与安全审计,让大模型调用从混乱走向工程化。
- 通过批处理将大模型 API 的吞吐量提升数倍,核心原理在于重构请求的提交方式:从单次推理转变为批量推理。每一次独立的 API 请求,模型都需要重复加载系统指令并初始化注意力机制,这带来了不小的固定计算开销。而批处理能将多个任务合并为一次推理,让模型在同一个上下文中并行处理,从而摊薄单次任务的成本。在正式调整架构之前,建议先在 KULAAI(dl.877ai.cn) 等聚合平台上做一轮基准测试... 通过批处理将大模型 API 的吞吐量提升数倍,核心原理在于重构请求的提交方式:从单次推理转变为批量推理。每一次独立的 API 请求,模型都需要重复加载系统指令并初始化注意力机制,这带来了不小的固定计算开销。而批处理能将多个任务合并为一次推理,让模型在同一个上下文中并行处理,从而摊薄单次任务的成本。在正式调整架构之前,建议先在 KULAAI(dl.877ai.cn) 等聚合平台上做一轮基准测试...
- 作者:马如悦,飞轮科技创始人每个数据团队都熟悉这样的期待:业务用户用自然语言问一句:"上季度亚太区月活用户数是多少?"或"为什么华东仓的履约时效在过去两周下降了?"系统就能立即给出准确、可追溯、可行动的答案。这正是 Agentic Analytics 正在描绘的下一代分析体验。相比传统 BI,Agentic Analytics 的变化不只是把问题换成对话框。它希望让 AI Agent 主动拆... 作者:马如悦,飞轮科技创始人每个数据团队都熟悉这样的期待:业务用户用自然语言问一句:"上季度亚太区月活用户数是多少?"或"为什么华东仓的履约时效在过去两周下降了?"系统就能立即给出准确、可追溯、可行动的答案。这正是 Agentic Analytics 正在描绘的下一代分析体验。相比传统 BI,Agentic Analytics 的变化不只是把问题换成对话框。它希望让 AI Agent 主动拆...
- 那些宣称“没有流程更高效”的团队,大多局限于规模小、人数少、需求简单的场景。一旦项目扩容、跨部门协作增多,缺乏流程约束只会带来需求混乱、责任不清、重复返工等更多的问题,反而拖慢整体效率。 那些宣称“没有流程更高效”的团队,大多局限于规模小、人数少、需求简单的场景。一旦项目扩容、跨部门协作增多,缺乏流程约束只会带来需求混乱、责任不清、重复返工等更多的问题,反而拖慢整体效率。
- 要让AI模型认为你的内容是“最值得引用”的,核心逻辑在于降低模型的“信息提取成本”,并同时提高其“信任度”。当AI在海量信息中筛选答案来源时,它会优先选择那些结构最清晰、数据最具体、且具备可验证权威性的内容。具体可以通过以下三个层次来实现:1. 基础层:让内容成为可直接摘抄的“标准答案”AI搜索引擎的核心任务是整合信息,而非重新创作。因此,信息的颗粒度和结构直接决定了被引用的概率。拒绝“散文... 要让AI模型认为你的内容是“最值得引用”的,核心逻辑在于降低模型的“信息提取成本”,并同时提高其“信任度”。当AI在海量信息中筛选答案来源时,它会优先选择那些结构最清晰、数据最具体、且具备可验证权威性的内容。具体可以通过以下三个层次来实现:1. 基础层:让内容成为可直接摘抄的“标准答案”AI搜索引擎的核心任务是整合信息,而非重新创作。因此,信息的颗粒度和结构直接决定了被引用的概率。拒绝“散文...
上滑加载中
推荐直播
-
华为云码道Skill实战与极速交付,智能开发全链路实战2026/07/22 周三 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;姜浩-华为云HCDG核心组成员
直播深度解读华为云码道6月产品新特性,从Skill市场安装专家技能,带你零距离体验从需求,开发,审查,重构全链路闭环的开发过程。从零构建并交付一个完整项目,让您体验从代码提交到服务上线的“极速”之旅。
回顾中 -
聚开发者之力,创具身新未来2026/07/23 周四 15:00-17:00
张豪杰/程文/王军/刘新春/黄钦开 /张晓天
本次华为云具身智能开发平台CloudRobo培训面向具身智能开发者,带您全流程体验机器人本体R2C小时级接入、环境重建与轨迹生成仿真数据生产、PB级数据管理、数据评测、模型训推、强化学习和Benchmark一键评测等功能,并体验业界主流具身模型应用。
回顾中
热门标签