微信扫码
添加专属顾问
我要投稿
图片识别
今天同事丢给我一张图片格式的思维导图,让我参考思维导图的结构写一个大模型的建设方案,但这张图有些内容不符合我们的实际,需要对这张图做一些修改,可是没有源文件。于是想到了上一篇文章中的方法,把图片丢给GPT-4o,让它给识别并生成markdown格式的文本,然后利用Xmind进行自动生成。
整体还是比较准确的,如下图所示:
读规划图
识别效果挺好,还做了结构化提取。
猜谜语
老婆逛商场时,看到中国黄金在做一个看图猜谜语的活动,于是发给我让我猜。
还是想到了GPT-4o。。。于是丢给它
这是他的分析结果,对不对不知道,反正看起来挺有道理的,我是一个没猜出来。有谁知道吗,可以评论区留个言~
以上都是利用大模型的视觉能力,相当于有了眼睛。
AI写作
前段时间又接到一个任务,写一个大模型应用场景设计思路,整体听下来又是拍脑袋的活儿,没啥意思。按照宝玉老师的分类,普通人日常的写作分三种:日常沟通、公文和创作。公文类就是各种报告、总结、文档等等,这种公文套话多,格式固定,但是费时费力,现在绝大部分公文都可以用 AI 帮助协作了。
这个设计思路也属于这种公文类。还是老套路,整理好提示词,反复尝试几次,同时丢给不同的大模型。
通义的回答:
基于上面的改一改基本就能用了。
几点思考
随着大语言模型逐步像多模态大模型转变,模型拥有更多模态的能力,应用场景会越来越多。
目前AI写作、AI数据分析还是存在局限性,普通人要想用好AI写作,必须结合自己的数据,靠丢几篇文章和提示词很难让大模型写出比较好的效果。比如我毕业这么多年,电脑产生了这么多文件,但这些文件又不方便上传到联网的大模型,如果这个时候我的电脑或手机本地部署了大模型,能直接访问这些文件,把我的整个电脑变成一个知识库,这个知识库随着我的使用,不断更新,成为我的第二大脑,在使用写作类似功能时,部署在本地的大模型可以直接读取我本地的文件,这样大模型写的内容就会像我本人写的,同时又不上传到互联网大厂服务器上。
像Notion这种笔记软件已经有了AI写作功能,但只能访问笔记内的数据,如果能从操作系统层面直接访问本地文件是最好的。由于硬件的限制,现在AI PC部署的大模型能力有限,好消息是小参数量的大模型能力越来越强了,苹果等公司也做了一些探索。AI PC和AI智能手机应该能激发一波购买需求~
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-04-30
用AI大模型把手写笔记转换为LaTeX PDF文档
2025-04-30
Qwen能吞下整本扫描版PDF,直接转Word了,这波操作太赞了!
2025-04-28
3D 小白亲测:用 Trae + Blender MCP 从零开始 AI 建模(附踩坑指南)
2025-04-27
行业落地分享:作业帮问答检索系统实践
2025-04-27
大模型赋能CAD图纸智能识别与集成实战指南
2025-04-25
英伟达推出 Describe Anything 3B AI 模型了
2025-04-24
OpenAI 图像生成 API 开放!开发者也能“一键出图”了
2025-04-24
OpenAI终于放出图像生成模型 API ,Midjourney危!
2024-09-12
2024-06-14
2024-06-17
2024-08-06
2024-08-30
2024-05-30
2024-11-28
2024-10-07
2024-10-16
2024-04-21
2025-04-08
2025-04-05
2025-03-30
2025-03-26
2025-03-05
2025-03-02
2025-01-08
2024-12-13