flyws's recent timeline updates
flyws

flyws

V2EX member #150150, joined on 2015-12-06 02:21:46 +08:00
Today's activity rank 2806
flyws's recent replies
同意楼上说的,现在扎堆推出这个个人 Agent 是可能这些前沿厂商已经感受到 coding 领域增长乏力了。我个人的看法是 coding 领域会逐渐进入成熟期,然后成熟期一个常见的做法就是降本增效:

直接使用前沿模型 API =》 考虑使用第二梯队的 API =〉考虑用类似 openrouter 之类的中转站 API =》 开始考虑自己部署模型分流 =〉大多数情况下使用开源模型

目前在 GPU 买不到的情况下,coding 领域再怎么走也走不到最终点,可能就是企业客户逐渐考虑用部分开源模型替代闭源模型,因为现在 coding 领域的能力增长对于大多数场景已经有点过剩了,比如没人直接一开 Claude 就用 Fable ,目前很多的分数其实是 Harness 带来的,一说到 Harness 那家家都有难念的经,大概率需要自己微调定制一下

B 端没有找到更赚钱的场景,那感觉只能去 C 端看看了,但是说句实话现在会愿意试这个个人助理的人,大概率还是互联网等行业的人,一般人真的没有场景。我更看好国内厂商找到这个下沉的场景,比如豆包对老年人使用场景的封装是真的有研究的,我觉得我们说 gemini 是美国豆包,而不说豆包是中国 gemini ,其实部分有肯定豆包在下沉市场的成功……

我觉得这个形态还是不太对,肯定会赢一些用户,但是我感觉人群还是跟 coding 的那一批人有很多重叠。国外可能还好一点,但是国外的问题在国内并不存在。对于这个个人代理,我其实非常看好手机厂商,他们掌握的这个入口短时间内是推不翻的。我目前个人对戴多个眼镜、别多一个录音笔什么,毫无兴趣。

这样来看,虽然不知道 A/会不会跟进,但是不得不佩服他们真的是有专心在做企业市场,别的不说,注意力真的很集中。
Aug 19
Replied to a topic by 1258 › 程序员 › qwen3.8 27B 被低估了
@tisswb 慢,也可以说很慢,我跑的是 ollama 的 mtp fp8 版,我没有细测,体感应该就是 10 tok/s ,加上 qwen 这一款默认比较长的思考链(但优点就是想得细致和全面),做起任务来基本都是按分钟计。dgx spark 拿来纯推理是浪费钱,但是如果你也会玩玩 pretrain 或者 finetune 的话,需要英伟达生态做实验的话,它的 tensor 算力还是合格的。而且因为 128G 显存我也拉满了上下文。

但是令我惊喜的是我等了比如 5 分钟,它真的把任务 one shot 完成了(其他更多参数的 AI 可能会 fail 同样的任务),所以目前的使用体感是只要等得起,可以基本放心交给它,我个人使用反正也不急。

跟前面某一楼提到的一样,就是水平到了这样的一个阶段,很难去评判它是比某一个模型强还是弱,但虽然很难量化,但是确实让我惊喜,会开始让我更加信任本地小模型,这在之前是没发生过的事情。昨天晚上它连上 craft agent 然后它自己 one shot 成功更新了我的定制化安装,有点厉害。
Aug 18
Replied to a topic by 1258 › 程序员 › qwen3.8 27B 被低估了
Qwen3.8 27B 确实很不错,我使用几天了,在 DGX Spark 上面的问题除了慢,还真挑不出了,对于我的一个改 PDF 的 use case ,它表现达到了 opus 水平,完成了我的要求。同样的 prompt 扔给 DeepSeek v4 Flash ,GLM 5.2 ,Kimi3 都没有做出来(都忽略了保持背景颜色一致)

我并不是想表达 Qwen 3.8 27b 暴打更大的模型,但是当我本地跑起来 Opus 级别的模型的时候,确实有一种原子弹爆炸的感觉。我觉得没有被低估,只是本地跑 AI 模型的可能还是少数,但是我相信未来这会变成大多数(都说 token 类比水电煤了,自己发电不好吗 )
刚好在学一些相关的英文书,然后试用后可以看出作者的这个中文版互动学习做得真的很不错,特地来评论支持。

不过好奇问一句这个的设计是先有中文版再翻译成英文,还是其他步骤?英文阅读了之后我感觉中文的表达比英文好很多,英文看起来像是按照中文翻译出来的,不过我也可能猜错了
很久之前看到这种我也不理解,但当工作上干起牛马活来的时候才发现这很正常,其实包括我在内,上面很多评论都已经提到点上了——就是碰到同事分享的、自己碰到的等等一些需要阅读的网页/视频/播客,或者是同时进入几个项目我知道这些页面过几天还得打开,但是当下状态不想读/读不了那么长的内容,那就放那了。

我个人觉得这有点类似之前 GTD ( Getting Things Done )的哲学,这些标签页就类似于扔到了 inbox 里面,等后面大脑有带宽的时候再来处理。这样一来就衍生出了 Tab Groups 、不同窗口、不同浏览器之类的标签型玩法,帮助后面迅速从“图书馆”里抽出相关 context 来
Jan 6, 2025
Replied to a topic by lifehz › Apple › mac air m1 能搭 deepseek v3 吗?
Deepseek v2.5 或者 Qwen 这些目前本地更有戏,这些在排行榜上我记得都接近老的 GPT-4 ,不过即使 Q4 的话大概都需要 8 ~ 10G 内存,所以其实现在 Macbook 统一显存内存后,运行 LLM 最大的卡点还是到底有多少内存,想玩遍主流各种大模型的话,最好还是拉满 128G ,至少也得有个 16G ,不然大多数模型都跑不起来。

本地跑 LLM inference 还是很有意思的,比如高铁或者飞机上想写点代码但是网络不稳定,那本地有个 Deepseek 2.5 级别的编程助手已经是很提升效率了。

建议楼主可以下载个 LM Studio https://lmstudio.ai ,方便自己开始研究实操这些
GPT-4 使用稍微修改一下的 Prompt + Wolfram Plugin 可以一次正确解答出来🙆。这是不是就像一个逻辑霸主找到了一个数学计算小王子,两两结合的力量?另外不确定 Bing 是怎么直接创造出来正确答案的,我怀疑是他的训练数据里面带了这个,不然从大语言模型原理,我无法理解他怎么一次性做对的。

Prompt:
请问,如何使用 3 、3 、7 、7 四个数字算出 24 ?

要求:
1. 每个数字必须使用一次,且只能使用一次
2. 只能使用加减乘除和括号。
对于喜欢偏接地气风格的朋友们,强烈推荐田野上的繁荣 https://space.bilibili.com/588278127/
已经直接购买支持!继续加油!
顶一波,非常喜欢这个创意。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2812 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 17ms · UTC 15:31 · PVG 23:31 · LAX 08:31 · JFK 11:31
♥ Do have faith in what you're doing.