Leo客堂

记录与分享

从辅助工具到超越人类医生——AI 在医疗影像与诊断上的进步速度,正在改写「看病」这件事。

医疗 AI

一条让人沉默的新闻

Google 旗下的医疗 AI 模型 Med-Gemini 在 14 个医学基准测试中,有 9 项超越了人类专家医生的平均水平。在乳腺癌筛查、眼底影像诊断、胸部 CT 读片等任务上,AI 的准确率和一致性都已经达到了专家级别。

这不是实验室里的数字游戏——它意味着,在医疗资源匮乏的地区,一部手机 + 一个模型,可能就能顶上一个资深影像科医生。

医疗 AI 究竟强在哪?

1. 影像诊断:从「比人快」到「比人准」

传统影像 AI 只能做单一任务(比如只识别肺结节)。而基于大模型的多模态 AI 可以:

  • 🔬 同时看 CT、MRI、X 光、病理切片
  • 📋 结合病人的病历、化验单、主诉文字综合判断
  • 🧠 给出带推理过程的诊断建议(不是黑箱结论)
1
2
3
输入:患者胸部 CT + 病历(咳嗽 2 周,低热)
输出:疑似右肺中叶炎症,建议结合血常规判断,
需排除结核可能(患者有流行病学接触史)。

这种「看得懂图 + 读得懂病历 + 说得出推理」的能力,是过去小模型做不到的。

2. 药物研发:把 10 年压缩到 1 年

AI 正在颠覆制药行业最贵的环节——「找靶点 + 筛分子」:

阶段 传统方式 AI 加持
靶点发现 2-3 年 数月
先导化合物筛选 上百万次实验 虚拟筛选 + 生成
临床前优化 反复试错 预测性优化

DeepMind 的 AlphaFold 已经预测了几乎所有已知蛋白质的结构,这本身就是诺贝尔奖级别的突破。

3. 个性化治疗:从「千人一方」到「量体裁衣」

基于患者的基因组、病史、生活习惯,AI 可以:

  • 预测某种药物对该个体的疗效和副作用
  • 推荐最优的剂量方案
  • 识别高危人群进行早期干预

但冷静一下:AI 还不能取代医生

⚠️ 责任归属问题

如果 AI 误诊了,谁负责?模型开发商?医院?还是签字的医生?法律和监管还没跟上。

⚠️ 数据偏见

训练数据主要来自发达国家的医疗体系,AI 对罕见病、少数族裔、发展中国家常见病的识别率明显偏低。

⚠️ 「黑箱」难题

即便准确率高,医生也不敢完全信任一个无法解释推理过程的模型。可解释性(XAI)是医疗 AI 落地的关键瓶颈。

⚠️ 监管门槛

FDA、NMPA 对医疗 AI 的审批非常严格,从实验室到临床,平均还要 2-3 年。

我看到的未来

短期内,AI 不会「取代」医生,而是会成为医生的超级副驾驶:

  • 🏥 三甲医院:AI 帮医生处理海量影像初筛,医生聚焦疑难病例
  • 🌍 基层 / 偏远地区:AI 弥补专家短缺,让优质诊断能力下沉
  • 🏠 家庭场景:可穿戴设备 + AI,实现慢病的实时监测与预警

真正让我兴奋的是最后一点:AI 有可能让「医疗资源不平等」这个困扰人类几十年的问题,第一次有了技术解。

当一个偏远山村的卫生所,通过一部手机就能获得顶级影像科医生的诊断能力——这才是 AI 最值得被记住的贡献。


延伸阅读:

AI 改变医疗的故事才刚刚开始。本博客会持续关注这个方向,欢迎订阅 RSS。

当 Meta 把 Llama 放出来免费商用,大模型从「巨头特权」变成了「人人可玩」。

开源大模型

从「闭源碾压」到「开源追平」

一年前,开源模型和 GPT-4 之间还隔着一道明显的鸿沟。但 Meta 的 Llama 系列(以及 Mistral、Qwen、DeepSeek 等一众开源选手)正在以惊人的速度把这个差距缩小——甚至在某些基准测试上实现了反超。

这不是偶然,而是一场有组织的「起义」。

为什么开源能追上来?

1. 模型架构早就不是秘密

自从 Transformer 论文发表、GPT 路线被验证,核心架构基本透明。真正的差距在于数据质量训练算力。而:

  • 高质量数据集的做法被越来越多团队掌握(SlimPajama、RedPajama 等)
  • LoRA、QLoRA 等微调技术让普通 GPU 也能训练出专用模型

2. 社区的力量

一个有趣的现象:每当 OpenAI/Anthropic 发布一个新能力(比如 function calling、工具调用、多轮规划),开源社区通常在 1-3 个月 内就能复现并开源出来。

1
2
3
4
5
# 用 transformers 加载一个开源 Llama 模型,就这么简单
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3-8B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3-8B-Instruct")

3. 商业模式的转变

Meta 激进开源的策略,本质是用「免费」拖慢竞争对手的 API 收入。当免费模型够用时,谁还会每月付 $20? 这对 OpenAI 的商业化是实打实的威胁。

开源 vs 闭源:怎么选?

场景 推荐选择 原因
通用聊天 / 写作 闭源(GPT-4o、Claude) 综合能力仍是 SOTA
企业内部知识库 开源(Llama 3、Qwen) 数据不出域,合规可控
中文场景 开源(Qwen、DeepSeek) 中文优化更激进
边缘设备 / 离线 开源(小参数蒸馏) 不依赖云端,隐私友好
复杂推理 / 代码 闭源暂时领先 但差距在快速缩小

本地跑一个大模型有多简单?

Ollama 为例,一行命令就能在 MacBook 上跑起来:

1
2
3
4
5
6
7
8
# 安装
brew install ollama

# 启动服务
ollama serve

# 跑一个 Llama 3(8B 参数,约 4.7GB 下载)
ollama run llama3

下载完直接进入对话模式,断网也能用。这是闭源 API 永远给不了的自由。

我的判断

我认为 2026 年之后的格局会是「双轨并行」:

  • 🏢 闭源模型继续扛起「天花板」的角色,推动最前沿的能力边界
  • 🆓 开源模型占据「地板」,让 AI 能力像水电一样普及、廉价、可私有化

对开发者来说,这是最好的时代:你可以用开源模型搭出 80 分的产品,再在关键节点用闭源 API 拉到 95 分。

下一篇我会聚焦一个更垂直、更震撼的方向——AI 正在如何颠覆医疗诊断。


相关链接:

从「打字交流」到「开口即聊」——GPT-4o 把 AI 助手拉进了真正的实时对话时代。

GPT-4o 多模态

一句话理解 GPT-4o

OpenAI 发布的 GPT-4o(其中的 o 代表 omni,即「全能」)是首个原生支持文本、视觉、音频三种模态的端到端模型。它不再像过去那样「语音转文字 → 文字处理 → 文字转语音」分三步走,而是直接理解并生成音频。

这意味着什么?延迟从几秒压缩到了 200 多毫秒——几乎和真人对话一样快。

它强在哪?

1. 真正的实时语音

以前用 ChatGPT 语音模式,你问一句话,它要愣 2-3 秒才能回答。GPT-4o 把这个延迟砍到了人类对话的舒适区间(约 320ms)。更关键的是,它能感知你的语气、情绪、停顿,甚至能在你说话时随时被打断——这才是自然对话的样子。

2. 视觉理解能力

打开摄像头,GPT-4o 可以:

  • 📐 实时讲解你手写的数学题步骤
  • 🌿 识别你桌上的植物并告诉你养护方法
  • 🖥️ 看着你的屏幕帮你 debug 代码
  • 😊 根据你的表情判断是否听懂

3. 成本与速度的双杀

指标 GPT-4 Turbo GPT-4o
文本处理速度 基准 快 2 倍
API 价格 基准 便宜 50%
语音延迟 2-3 秒 ~320ms
50 种语言 一般 优秀(中文 token 效率大幅提升)

对普通人的影响

🎓 学习场景

想象一个 24 小时在线、看得见你作业、听得懂你提问的私人老师。GPT-4o 的语音 + 视觉能力,让「AI 家教」从概念变成了现实。可汗学院已经在集成。

🧑‍💻 工作场景

  • 写代码时,屏幕共享给 AI,它能直接指出哪里写错了
  • 开会时实时翻译 + 记录 + 总结(支持 50+ 语言)
  • 设计师可以边画草图边听 AI 的修改建议

⚠️ 需要警惕的地方

  • 情感依赖:真人般的语音容易让人产生情感错觉,OpenAI 自家也在研究这个问题
  • 滥用风险:实时语音钓鱼(scam)的门槛被大大降低
  • 隐私:开着摄像头让 AI 看,数据怎么用、存多久,需要明确

我的思考

GPT-4o 最大的意义不是「又变强了一点」,而是把 AI 从工具推向了伙伴。当交互延迟降到毫秒级、当 AI 能听能看能即时回应,我们使用 AI 的方式会从「写 prompt」变成「随口一问」。

这让我想起智能手机取代相机的那个拐点——不是因为手机像素更高,而是因为它永远在你口袋里。GPT-4o 正在让 AI 走向同样的拐点。


延伸阅读:

下一篇我会聊聊开源大模型(尤其是 Llama 系列)如何冲击这个被巨头垄断的赛道。敬请关注。

欢迎来到 Leo客堂 🎉 这是我用 Hexo 搭建的个人博客,在这里我会记录自己的学习与生活。

为什么开这个博客?

一直想有个属于自己的角落,可以:

  • 📝 把学过的知识整理成笔记
  • 🔧 记录项目中踩过的坑和解决方案
  • 🌱 督促自己持续输出、持续成长

这套博客怎么搭的?

非常简单,只用了三步:

1
2
3
4
5
6
7
8
# 1. 初始化项目
npx hexo-cli init leo-blog

# 2. 进入目录并安装依赖
cd leo-blog && npm install

# 3. 启动本地预览
npx hexo server

主题用的是 NexT,简洁好看、对中文友好。

如何写新文章?

只需一条命令:

1
npx hexo new "我的新文章"

然后在 source/_posts/ 下用 Markdown 尽情书写即可。


「种一棵树最好的时间是十年前,其次是现在。」

就从今天开始吧 ✨