AI Pulse
📡 X 信号

开发者花30分钟用蚂蚁百灵开源大模型做出作业订正工具

开发者花30分钟用蚂蚁百灵开源大模型做出作业订正工具

无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。

现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。

我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。

后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。

🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。

但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。

这里也有个很容易误解的地方: 视觉模型,不等于出图模型。

Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。

Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。

🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。

先让大模型直接干活,再让大模型教小模型干活。

这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。

OpenRouter现在可以免费使用Ling-3.0-flash-VL:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新