首页AI 百科
概念解释

AI 百科

用简明语言解释 AI 工具选型时常见的概念,并给出相关工具入口。

基础概念

大模型

大模型(Large Language Model,LLM)是通过大规模数据训练、能够理解和生成文本、代码、图像或多模态内容的 AI 模型,是当前 AI 工具的能力底座。

大模型是「用海量数据训练出来的概率模型」:它从互联网文本、代码、书籍等数据中学习语言规律和知识模式,再根据输入预测并生成后续内容。模型的「智能」来自数据规模、参数规模和训练方法,而不是内置了某个知识库。 选型时通常关注六个维度:推理能力——复杂逻辑、数学和代码任务的表现;上下文长度——一次能处理多少文本,决定能否读完整份文档;多模态能力——是否支持图片输入理解、生成等;价格——按 token 计费,不同模型差异很大;延迟——响应速度是否满足业务要求;数据合规——训练数据、处理位置和隐私政策。 对普通用户来说,大模型的能力差异体现在日常使用中:DeepSeek 在推理和中文问答上表现突出,ChatGPT 生态完整、多模态覆盖广,豆包和通义千问中文体验好、免费额度大,Claude 擅长长文档和代码。选择时先明确任务类型,再对比价格和免费额度,而不是只看参数规模。 常见误区是把「参数越大越强」当作唯一标准:实际业务中,延迟、成本、上下文和数据策略往往比参数更重要。一个 7B 的小模型在特定任务上可能比千亿参数模型更实用,因为它更快、更便宜、更容易部署。

应用形态

智能体

AI 智能体(Agent)是能自主规划任务、调用工具、执行多步骤流程的 AI 应用,区别于单轮问答的聊天助手,代表产品包括 Coze、Dify 构建的客服与办公智能体。

智能体的核心能力是「自主性」:它不只是回答问题,而是能把一个目标拆解成多个步骤,按顺序执行,并在过程中调用外部工具。例如「帮我整理上季度客户续约风险」这个任务,智能体会先检索客户数据,再调用分析工具,最后生成报告。 智能体的组成通常包括:大模型(大脑,负责理解和决策)、工具(手,负责检索、计算、操作外部系统)、知识库(记忆,提供业务资料)、工作流(流程,定义步骤和规则)。构建平台如 Coze(零代码、多渠道分发)、Dify(开源、全流程)、FastGPT(中文知识库优化)降低了搭建门槛。 选择智能体方案时要先回答三个问题:数据能否出内网——不能就选支持私有化的方案;团队有没有工程师——没有就选托管平台;任务是否高风险——支付、删除、对外发布等动作必须设置权限和人工确认。 常见误区是把智能体当作「完全无人值守的员工」:实际上,越复杂的智能体越需要日志、失败兜底、权限边界和人工接管机制。智能体擅长执行规则清晰的任务,不擅长在没有监督的情况下处理高风险决策。

工程方法

RAG

RAG(Retrieval-Augmented Generation,检索增强生成)是把外部知识检索与大模型生成结合的架构,让 AI 基于企业自己的文档回答问题并给出引用,减少幻觉。

RAG 解决的核心问题是「大模型不知道你的业务资料」:模型训练有截止时间,也不包含企业内部文档。RAG 的流程是:先把文档切分、向量化存入知识库;用户提问时检索相关内容;再把检索结果连同问题一起交给模型,让模型基于检索内容回答。 RAG 的关键环节有四个:文档解析——PDF、扫描件、表格的解析质量决定信息是否完整;切片策略——按章节结构切分比固定字数更合理;检索质量——召回率和排序决定模型拿到的是不是正确答案;上下文组织——检索结果要过滤、排序、重写,不能全塞进提示词。 落地平台方面:Dify(开源、全流程)、FastGPT(中文优化)、RagFlow(文档解析强)、Coze(零代码)各有侧重。评估 RAG 效果要用真实评估集:准备 50-100 条问题、标注参考答案,统计检索命中率和回答准确率,而不是凭感觉判断。 常见误区是「把所有文档丢进知识库就等于完成 RAG」:实际上文档清洗、权限设计、评估迭代才是决定效果的关键,RAG 是运营出来的,不是一次部署就结束的。

生成能力

文生图

文生图(Text-to-Image)是通过文字描述生成图像的 AI 技术,代表工具有 Midjourney、Stable Diffusion 等,广泛用于插画、海报、商品图和视觉灵感探索。

文生图的工作原理是模型理解文字描述后,从训练数据中学习到的图像规律里生成匹配画面。当前主流工具的能力差异主要体现在:风格上限——Midjourney 的艺术感和画面质量领先;可控性——Stable Diffusion 支持本地部署和精细控制;中文支持——国产工具对中文提示词理解更好;商用授权——各平台规则不同。 使用文生图的典型流程:明确画面主体、场景、风格和构图 → 用提示词描述(中文工具用中文,英文工具建议英文)→ 生成多张初稿 → 用变体、放大和局部修改收敛 → 人工挑选和精修。 版权和合规是文生图最容易踩的坑:生成图不一定可直接商用,涉及真实人物、商标、字体、素材和平台授权都需要确认;生成内容的版权归属因平台而异,商用前要读条款。 选择工具时先问自己的需求:探索视觉方向选免费档即可;高质量商用素材要评估授权和订阅成本;需要完全可控和私有化选本地部署方案。百器工具库的「AI 图像」分类收录了国内外绘图工具,标注价格模式和适用场景,方便对比。

生成能力

文生视频

文生视频(Text-to-Video)是通过文字或脚本生成视频片段的 AI 技术,用于广告分镜、创意验证和短视频素材。

文生视频的核心能力是把文字描述转化为动态画面,当前主流工具支持文生视频、图生视频和脚本生成。技术现状:短片段(5-15 秒)质量可用,长片段的连续性、角色一致性和物理细节仍需筛选。 适用场景:广告分镜——快速验证镜头和画面方向;创意验证——在正式拍摄前测试概念;短视频素材——辅助内容创作。 使用注意:中文脚本支持因工具而异,国产工具对中文脚本理解更好;生成内容涉及肖像、配乐和素材版权,商用前确认授权。 选型建议:创意验证用免费额度,正式项目评估授权和成本。百器「AI 视频」分类收录国内外视频工具,标注价格模式与适用场景。

使用方法

提示词

提示词(Prompt)是用户给 AI 模型的指令和上下文,包含目标、背景、约束和输出格式,是控制 AI 输出质量的核心手段。

提示词不是「咒语」,而是「任务说明书」:把任务描述得越清楚,AI 的输出越可控。一个高质量的提示词通常包含四部分:角色——让模型以什么身份回答;背景——提供必要上下文;任务——明确要做什么;约束——限定格式、长度、语气和边界。 示例对比:差的提示词「帮我写个方案」,好的提示词「你是一名产品经理,请为面向中小企业的 AI 客服工具写一份 500 字的产品方案,包含目标用户、核心功能、定价策略和落地路径,输出 Markdown 格式」。后者的结果质量会明显更高。 提示词的作用边界也要清楚:它不能解决所有问题。模型能力、知识截止和事实准确性不受提示词控制,关键信息仍要人工核实。提示词模板适合高频重复任务(写作、绘图、客服),但模板不能适配所有业务,要用真实任务样本测试和迭代。 在百器工具库的「提示词」分类下,可以找到提示词模板、提示词优化工具和提示词学习资源,按需组合使用。

工程方法

向量数据库

向量数据库(Vector Database)是存储和检索向量数据(embedding)的专用数据库,是 RAG 和 AI 检索应用的基础组件。

向量数据库解决的核心问题是「语义检索」:传统数据库按关键词匹配,向量数据库把文本、图片等内容转成向量,按语义相似度检索,能理解「怎么用」和「如何使用」是同一意思。 主流向量数据库包括 Weaviate、Qdrant、Milvus、pgvector 等,选择时关注:检索性能——百万级数据的查询延迟;混合检索——向量+关键词组合;部署方式——开源自托管 vs 云服务;生态集成——与 RAG 平台(Dify、RagFlow)的兼容性。 在 RAG 应用里,向量数据库决定检索召回质量:索引策略、距离度量和过滤条件都会影响结果。选型建议:小规模用内置默认方案,大规模或高并发评估独立向量库。

质量治理

模型评测

模型评估(Model Evaluation)是对 AI 模型能力进行量化测试的过程,包括基准测试、人工评估和业务指标,是选型和优化模型的基础。

模型评估回答的问题是「这个模型到底行不行」,而不是「看起来行不行」。评估方法分三层:基准测试——用公开数据集(如数学、代码、推理基准)测通用能力;人工评估——用真实任务样本让用户打分,更贴近业务;业务指标——上线后的准确率、用户满意度、成本等实际数据。 常见误区:只看排行榜分数——公开基准与真实业务差距大;只测演示案例——精心挑选的例子不代表稳定表现;没有基线——不知道换模型是变好还是变差。 正确做法:准备 50-100 条真实业务问题,在候选模型上跑同一批测试,记录准确率、速度、成本和失败案例,用数据决定选型。

使用方法

提示词工程

提示词工程(Prompt Engineering)是设计、优化和系统化提示词以稳定提升 AI 输出质量的方法论,是 AI 应用落地的重要技能。

提示词工程的核心不是「咒语」,而是任务设计:把需求描述得清楚、完整、可执行。方法论包括:角色设定——让模型以特定身份回答;上下文提供——给出背景和约束;输出规范——明确格式、长度和边界;示例引导——用例子示范期望的输出。 进阶技巧:思维链——让模型分步推理,复杂问题更准确;少样本——给几个示例再提问,输出更稳定;迭代优化——基于输出反馈调整提示词。 实践建议:把高频任务的提示词沉淀成模板和团队规范;用真实任务样本测试提示词的稳定性;提示词解决不了模型能力问题——事实、推理和数据策略需要从模型和流程层面解决。

应用形态

AI 工作流

AI 工作流(AI Workflow)是把多个 AI 能力、工具和人工审核点串联起来完成复杂任务的流程设计,是 AI 从「单点工具」走向「业务系统」的关键。

AI 工作流的本质是编排:把「写文案」「生成图片」「查资料」「人工审核」等步骤串成一条流水线,每个步骤的输入来自上一步的输出。好的工作流设计关注三件事:任务拆解——把大任务拆成 AI 擅长的小步骤;人机分工——AI 负责效率,人负责判断,关键节点保留人工审核;失败处理——每步设置校验、重试和降级。 落地工具:Coze、Dify 提供可视化编排;LangGraph 等框架提供代码级控制。选择标准:流程复杂度、数据私有化要求和团队技术能力。 常见误区:一上来就追求全自动——自动化放大错误;把流程写死——业务变化后难调整;忽略监控——上线后没有日志和复盘。正确路径是从半自动开始,逐步标准化再自动化。

模型能力

多模态 AI

多模态 AI(Multimodal AI)是能同时理解和处理文本、图像、音频、视频等多种信息类型的 AI 技术,是当前 AI 产品的主流方向。

多模态 AI 让模型不只处理文字:能看懂图片内容、听懂语音、理解视频画面,并在这些信息之间建立关联。典型应用包括:图像理解——拍照识别、图表解读;语音交互——语音问答、会议转写;文档理解——带图文档、表格、扫描件;多模态创作——文生图、文生视频。 当前国产产品的多模态覆盖:豆包支持图片、语音和文档;通义千问支持图像和文档理解;Kimi 支持图片输入和长文;DeepSeek 以文本和推理为主,多模态创作需搭配绘图视频工具。 选型建议:日常多模态(拍照、文档、语音)选豆包或通义;专业图像理解评估专用模型;创作类(文生图/视频)用专门的绘图视频工具。多模态能力还在快速迭代,功能边界以官网为准。

开发工具

AI 代码助手

AI 编程助手(AI Coding Assistant)是集成在开发环境中的 AI 工具,提供代码补全、对话编程、代码解释和 Agent 任务执行能力,代表产品有 GitHub Copilot、Cursor、Claude Code 等。

AI 编程助手分三种形态:代码补全型——在编辑时预测下一段代码,降低打字量(GitHub Copilot);对话编程型——用自然语言描述需求,AI 修改多个文件(Cursor、Windsurf);终端 Agent 型——在命令行自主执行长任务(Claude Code、Codex CLI)。 使用价值:效率提升——重复代码、测试补齐、文档生成显著加速;学习辅助——代码解释和报错分析降低上手门槛;重构支持——跨文件修改和大规模重构。 安全边界:AI 生成代码必须人工 Code Review;敏感代码、密钥和客户数据不上传个人版;生产代码保留测试和回滚。 选型建议:按主要场景组合——日常补全用 Copilot,功能开发用 Cursor,长任务用 Claude Code,国内团队可评估通义灵码等国产方案。

安全治理

AI 内容检测

AI 内容检测(AI Content Detection)是识别文本、图片、视频是否由 AI 生成的工具,用于内容审核、学术诚信和反欺诈场景,但检测准确率存在边界。

AI 内容检测的原理:文本检测通过分析语言模式的统计特征(困惑度、重复度、AI 常见措辞)判断;图像检测通过识别生成痕迹(伪影、不自然的细节)判断。 检测的局限性:误判——人类写的内容可能被判为 AI,尤其是模板化、正式语气的文本;漏判——经过改写、翻译的 AI 内容难以检测;对抗——刻意设计可绕过检测。 使用建议:AI 检测结果作为参考信号,不单独作为判定依据;高风险场景(论文、作品、发布内容)结合人工审核和证据链;被误判时保留创作过程证据。 对内容创作者:了解检测工具的逻辑,避免无意识的高 AI 相似度,保留草稿和过程记录。

基础概念

AGI(通用人工智能)

Artificial General Intelligence,能够在大多数认知任务上达到或超过人类水平的通用人工智能,是 AI 领域的长期目标。

与当前「专用于特定任务」的窄 AI 相对,AGI 强调跨领域迁移、自主推理与持续学习能力。业界对 AGI 的定义和时间表分歧很大:部分厂商将 Agent 能力视为通往 AGI 的路径,也有研究者认为现有大模型范式无法直接到达 AGI。选型时的务实视角:不必为「接近 AGI」的营销话术买单,重点仍看任务基准、成本与可靠性。

基础概念

Token

大模型处理文本的最小单位,一个汉字通常约 1-2 个 Token,一个英文单词约 1-1.5 个 Token,是计费与上下文长度的基本单位。

API 定价通常按「输入/输出每百万 Token」计费,输出价格一般是输入的 3-5 倍。选型对比时务必把「上下文窗口大小」和「单位价格」放在一起看:窗口大但价格高,长文档场景的实际成本需要按任务样本估算,而不是只看标价。

基础概念

上下文窗口

模型单次对话能「记住」的最大文本长度,以 Token 计。当前主流从 128K 到 1M 不等,决定了一次能处理多长的文档或对话。

窗口大不等于用得好:超过一定长度后模型对中间内容的召回会衰减(中间遗忘)。长文档任务建议优先实测关键信息的召回质量,而不是只看官方标称的窗口数字。超长场景可配合 RAG 分段检索。

工程方法

MCP(模型上下文协议)

Model Context Protocol,Anthropic 于 2024 年开源的标准化协议,让大模型以统一方式连接外部工具、数据源与服务,被称为「AI 界的 USB-C」。

MCP 把「模型连工具」从各自为战的自定义集成变成标准接口:一个 MCP 服务器可以被 Claude、Cursor 等多个 Agent 复用。选型视角:如果你的团队要给 Agent 接入内部系统,优先确认该 Agent 是否支持 MCP,避免为每个工具重复开发集成。相关生态可参考站内 MCP Builder 等 Skill。

应用形态

Agent Skills

让 Agent 学会特定任务的标准化能力包:一个文件夹 containing 指令(SKILL.md)、脚本与资源,Agent 按需动态加载。由 Anthropic 提出并开源规范。

Skill 与 MCP 的区别:MCP 连接外部工具(数据进出),Skill 教会 Agent 做事的方法(流程与知识)。一个 Skill 通常包含任务指令、示例与可选脚本,安装后即让 Claude Code、Cursor 等 Agent 掌握新能力(如处理 Word、审查代码)。选型视角:关注来源(官方/社区)、是否含脚本执行、安全风险与维护状态——这正是本站 Skills 目录逐项核验的内容。

工程方法

思维链(CoT)

Chain of Thought,让模型先输出逐步推理过程再给答案的提示方法,可显著提升数学、逻辑与分析类任务准确率。

CoT 的效果来自「把思考过程显式化」,让模型在给出结论前完成中间推导。当前推理模型(如 o 系列、DeepSeek-R1 系)已把 CoT 内化为训练目标,会自动「思考」并消耗推理 Token——这类模型按推理过程计费,复杂任务效果好但成本更高。简单任务不必强制 CoT。

基础概念

RLHF

Reinforcement Learning from Human Feedback,人类反馈强化学习,用人类偏好数据训练奖励模型来对齐模型输出,是大模型「好用」的关键训练环节。

RLHF 决定了模型的语气、安全边界和「有帮助程度」,也是各家模型风格差异的主要来源。对选型的意义:模型风格偏好很主观,同一任务在 A 模型顺手在 B 模型别扭很常见——重要场景建议用自己的真实任务样本横评,而不是只看榜单。

工程方法

微调(Fine-tuning)

在预训练模型基础上,用领域数据继续训练,使模型稳定掌握特定风格、格式或知识。主流平台提供 SFT 微调服务。

微调适合「固定模式、高频调用」的场景(固定格式抽取、品牌语气、垂直领域问答),不适合知识频繁更新的场景(那应该用 RAG)。决策顺序建议:先试提示词工程 → 不够再试 RAG → 仍有大量重复模式才考虑微调——成本和维护复杂度依次上升。

基础概念

AI 幻觉

模型生成看似合理但与事实不符内容的现象,根源是语言模型按概率「补全」而非查证事实。是所有选型决策必须纳入的可靠性约束。

幻觉在高风险场景(法律、医疗、财务、引用)危害最大。缓解手段按成本排序:要求模型提供引用来源并人工抽查、接入 RAG 限定答案范围、用低温度参数、关键结论交叉验证。选型视角:宣称「绝不幻觉」的产品不可信,值得看的是它是否内置了引用、溯源与人工确认机制。

基础概念

推理模型

以「延长思考时间」换取复杂任务准确率的模型类型(如 o 系列、DeepSeek-R1、Gemini Thinking),会在作答前生成内部推理链。

推理模型在数学、代码、科学与分析类任务上显著强于普通对话模型,代价是更贵、更慢、消耗推理 Token。选型经验:日常问答/写作用普通模型即可,复杂推理/难题攻坚再切换推理模型——很多平台(如 OpenRouter)已支持同一会话按需路由。

生成能力

扩散模型

通过「逐步去噪」生成图像/视频的模型架构,是当前文生图与文生视频的主流技术路线(Stable Diffusion、Midjourney、即梦等均基于此)。

扩散模型决定了视觉生成的能力边界:构图合理性、光影真实感与提示词遵循度。选型视角:图像质量差异在「手部、文字、多主体关系」等细节上最明显,商用素材建议用自己的提示词集实测;开源权重(如 SD 系列)可本地部署但需要 GPU 资源。

工程方法

Function Calling

让模型按预定义的函数签名输出结构化调用参数的能力,是 Agent 调用工具、查询数据、执行动作的技术基础。

Function Calling 的可靠性直接决定 Agent 的可用性:参数是否合法、该不该调用、调用时机是否正确。选型视角:搭建 Agent 时优先选函数调用成功率高的模型,并用真实任务集测试「该调用时调用、不该调用时不乱调」两个方向;MCP 则是把函数调用标准化的协议层。