苏菲的工房

AI Agent 辅助期末复习经验

[方法]

先说明几点: 第一,以下内容均为本人个人经验和感受,不一定对你适用;第二,本人期末几乎完全靠这个复习,也勉强算得上是有了实战经验;第三,以下涉及的内容均为示例,读者也可根据自己情况进行修改和调整。


本篇为第一篇,介绍我是如何简单配置模型和 Agent 的。

首先,我们需要了解什么是 LLM(维基百科)、Agent(OpenAI,ChatGPT/Codex 的公司)/ Agent(Anthropic)、API(MDN)/ API(OpenAI)、Workflow(维基百科)、OCR(维基百科),我在这里引用一些文档供大家学习。

我们也可以看看锦恢大佬的教程(暂未完结):

这个更适合新人而非开发者。

我们实际上并不需要完全理解里面的原理,毕竟我们是医学生,不是程序员。所以接下来我会用自己的案例来演示如何构建一个属于自己的 Agent。

第一步:获取 API Key

首先,我们需要拥有一个 LLM 公司的账号,注册之后查看他们关于 API 调用的官方文件。比如说:

当然,还有其他的 LLM 和提供商,以及自己部署模型后为你提供服务的厂商(比如腾讯元宝),但这就不在我们的讨论范围了。

在这里我要补充很重要的一点:DeepSeek 这种 LLM 是纯文字模型(至少在我写的时候是这样,网页版有识图模式,但 API 暂时还没有。平时我们上传图片让 DeepSeek 解答的时候,本质上是 AI 提取文字之后再解答,因此也会出现未识别到文字的提示)。豆包/Kimi/mimo 等不少模型都支持多模态(图像、文字、视频、音频),所以如果你想要分析和制作图片的话慎用 DeepSeek,我个人这方面的工作是让 Qwen-vl-max 去做的。

粗略看过一遍后,我们接下来按照上面的方法,创建一个 API key。

注意: 请务必在创建之后以文档(txt)的方式将你的 key 保存下来,你将无法再次查看这串字符。GitHub(Git Official)token 同理。确定你已经保存且进行了合适的命名(比如 DeepSeek API key)后,再继续下一步。

如果你有免费的额度,或者你只是想试一试,可以稍微充个下限(注意,不同公司对充值的下限要求可能不同,你可以选择自定义价格),毕竟没必要一上来就充那么多钱。在确定你已经创建了 key,且 key 内有可用的额度。

第二步:选择 Agent

我们接下来就到了选择 Agent 的时间:

以上这些都是 Agent。我有两个比较推荐的视频,大家可以看看——是一个叫 网络小白_Uncle城 的 UP 主制作的,比文档更容易上手:

关于 Agent 我们要注意几点:首先是电脑操作系统的问题,如果你的系统和我一样是 Windows 的话,那步骤就和我的一样;如果是 MacOS/Linux 等 UNIX 系统的话,操作又会有不同。如果大家有什么不懂的也可以直接去问问 AI,他们在这类问题上可以给你进行解答。

接下来,我们需要下载一个 Agent。首先我们需要选择厂商,比如 OpenClaw / Codex / OpenCode / Hermes,他们各有各的优点和缺点,大家根据需求自行选择。

第二个要注意的问题就是,Agent 的使用方式,也就是 CLI(维基百科)/ CLI(GitHub)/ TUI(维基百科)/ GUI(维基百科),大家可以根据喜好自行选择,我现在用的就是 TUI。

接下来是下载环节。Agent 有几种下载方式:如果你选择的是 CLI/TUI,那么你可以直接在 PowerShell(Windows)/ Terminal(MacOS/Linux)复制下载的指令进行下载;GUI 或者是桌面软件就直接像下载软件一样。

我们下载好之后,注意将 Agent 加入 PATH(维基百科),这样之后使用会方便很多。如果有什么依赖的环境,按照 AI 的指导一步步解决就好。

第三步:配置模型

现在打开我们下载好的 Agent,我们根据官方文档上配置模型的路线一步步走。首先是选择供应商,注意对于非 OpenAI/Anthropic 的厂商,需要仔细阅读文档,确认他们支持哪种格式。比如 DeepSeek 就同时支持 OpenAI 和 Anthropic 两种格式。选择之后,我们需要将刚刚创建的 API key 输入,同时输入 LLM 厂商的 API 地址,比如 DeepSeek 的链接就分为这两种。

配置完成之后,我们需要选择使用的模型,比如 DeepSeek 有 DeepSeek v4 Flash 和 v4 Pro 两种模型。不同模型和厂商的参数、定价都有不同,不要盲目上最贵的模型(当然如果你很有钱另说)。

一切顺利的话,接下来,我们可以试着调整各项设置,比如 reasoning effort、reasoning on/off、/color 什么的,这个可以根据官方文档以及各类教程进行探索。接下来发一条简短的消息给 Agent,可以是"请复述这段话 ‘Hello, World’",如果成功返回 Hello, World 就说明成功;没有的话,就询问 AI 是什么地方出错了。

注意: 最好手动设置 Agent 的工作目录,不然到时候找不到东西就麻烦了。我是在 D 盘单独设置了一个 Agent 同名文件夹为工作目录,规定所有的缓存和日志 / 任务输出全部放在这个文件夹里。还有,记得做好文件分级管理,定期清理缓存和任务过程中的中间文档,做好备份。不然的话,过几个月里面全是不知道是什么的文件,找不到想要的文档可是非常让人头疼的。

第四步:建立复习 Workflow

以上内容解决之后,接下来就是我如何利用 Agent 帮助我复习课程的 Workflow(维基百科)了。

对于我们医学生而言,蓝皮书实在是太厚了,尤其是当你期末既要看书又要看 PPT,甚至可能还要刷题,任务量巨大,让人不知所措。所以我就借用 Agent 来辅助我完成期末复习。

4.1 整理资料

首先,清点我们手头上的复习资料:

4.2 转换与 OCR

接下来,我们需要将这些东西转换为 AI 能够阅读的东西。就我个人而言,简要的流程是这样的:

获取和整理所有的课程资料,按学科分门别类建立文件夹。比如我的就是:

D:\Hermes\course_file\临五医学教材\(各类课程PDF)
D:\Hermes\course_file\生理学\(PPT)

这样既方便自己查漏补缺,也方便进行文档管理,提升工作效率。

整理好文档后,让 AI 将这些文件编号(方便找),并按照编号进行处理。处理的方式是:首先自己查看一遍 PPT,如果有很多示意图什么的,就不能按文字和图表的处理方式,我等会会说。如果没有,我们就要求 Agent 对目录下的所有文件进行视觉分析,提取其中所有的文字,并保留原有的结构。(这一步很难一次成功,个人经验:概率主要取决于 PDF 的清晰程度。)

然后对每个文档任务进行到 1/3 时,对 OCR(维基百科)产生的 Markdown(官方)文档检测准确率(这一步可以进行样本量较大的抽样调查),也就是是否存在乱码、结构混乱、字符错误(比如经典的"锟斤拷"“烫烫烫"或者是不明的黑块),页码是否正确,有没有 OCR 时加入的版权页。每个文档经过这样的三次审核后,再整体抽样。所有检查成功通过后处理下一个文档。所有文档处理完成后,再有人工审核。一般经过这么几次后,准确率也基本够用了。

然后,我们让 AI 建立检索,不然的话不好找到每一个知识点出现的位置。到这里为止,我们就算完成了一个课程知识库的构建。

4.3 刷题

接下来,有了知识库,我们还需要刷题。这有几种办法:

  1. 你能找到题库并下载下来,放到目录
  2. 让 AI 自主提问

当然如果你有一份重点内容的文档,这个过程就会轻松得多。

4.4 实践

最后就是实践——通过和 AI 利用知识库进行问答巩固知识,应对考试。


由 Jerry Li 撰写 · 首发于 jerryli.cn