V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  kennylam777  ›  全部回复第 2 页 / 共 51 页
回复总数  1013
1  2  3  4  5  6  7  8  9  10 ... 51  
6 月 9 日
回复了 kakalulin 创建的主题 Local LLM mac mini 跑本地模型,需要什么配置?
暫時單機能跑智力過關的只有 Gemma 4 31B 或 Qwen 3.6 27B, 能做輕量開發, 我用 RTX 5090 跑這兩個 ctx 能達到 1024000 才算可以, 起碼跑 Claude Code 或 Github Copilot 還不算太易滿 context, MTP 能 90tps

Hermes Agent 的話, 以上兩個都未必能達到滿意水準, 還要用 Mac 跑 10B 以上的 Dense 速度感人。

Gemma 4 26B/Qwen3.6 35B MoE 就不用想了, 太弱, 處理簡單 coding 任務時還好, 但 MoE 的小 expert 才 3B/4B, Q4 後會更高機會 tool call 錯, 對 agentic operations 是大傷
6 月 8 日
回复了 Cheez 创建的主题 程序员 阿里的 Qwen3.7-Max 比我想象中差
@bowser1701 通常都跟模型有關, 長 context 是一種能力, Qwen 的收費版才有 1m context support, 但在 1m 觸發 compact 前就死循環那是長 context 能力不足了。

雖然我在本地用 Qwen 3.6 27B/35B 都只限在 256k 甚至是 200k, 不太會死循環, 但如果把 Weight 或 KV 壓成 4bit/Q4 就更容易會出現類似錯誤。

雖然在 inference 時的確能調 repeat penalty 去減少重覆回應, 但我測過能力弱的模型, 要死循環時你如何調也救不回來。
6 月 5 日
回复了 CatCode 创建的主题 Local LLM Gemma4 12B 如何跑在 16G 显存上?
Gemma4 12B Q4 GGUF 我測過是能跑得動 Github Copilot 的 tool use, 32GB 的 laptop 勉強能跑還有 ctx 65536, 小模型用輕量的 agent 例如 pi.dev 效果會更好

FP8 就留給 RTX Spark 的 laptop 吧, 5090 Mobile 24GB 也許還可以?

Gemma4/Qwen3.5 3.6 比上年的 Gemma 3/Qwen3 都強很多, 但 LLM 愈大愈強是必然的, 我用 5090 Desktop 還是在用 Qwen 3.6 35B A3B NVFP4 才算滿意, KV 都不敢壓
6 月 4 日
回复了 laoyutang 创建的主题 OpenAI 有重置了兄弟们
本來還省著用到 6 月 8 日, 想不到又 reset 了, 把麻煩問題都丟進去 Codex, 5.5 Extra High 開好開滿
5 月 29 日
回复了 beginor 创建的主题 Visual Studio Code VSCode 1.122.0 可以离线使用 BYOK
不錯喔, 之前我用的是 Claude Code + Qwen 3.6 35B MTP APEX Q5, 但 Claude Code 很多 plugin 都要 server side support 所以都有問題, 官方 Copilot 也比較好用的是拖曳檔案不用再按 Shift 了
Tech stack 差距不大, 但我用起來 Golang typecheck 比較嚴緊, 小問題在 compile 時就能發現, 後續痛苦度比較低。

Python 的話, pycompile 過也不一定能跑, 所以我加上了 ruff 及 pyright, 總算在用 Qwen 3.6 27B/35B A3B 配 Claude code 也能預早發現小問題, 總算能幹點粗活。

TypeScript 也一樣, 先把 `strict: true` 打開, 讓 LLM 自己修好。

先說一下我有在付費用 Codex 及 Antigravity, 但各 20 的額度還是不太夠。
這次更新太垃圾了, Flash 3.5 預設給你跑 Fast mode, 但 token 燒得倒水一樣快

更可惡的是還沒 GPT 5.5 Low 聰明

真的要考慮不續了, 我寧願把 Codex 升高一級
@songyoucai 不, 我在 Google IO 邊看 live 邊升級了, 然後 Antigravity IDE 按了也只是到 Agent only UI
我都要把 Antigravity uninstall 後才能裝回 Antigravity IDE 拿回 VS Code
API 及 AI studio 一直都有
5 月 18 日
回复了 randm 创建的主题 Google Gemini gemini 昨夜悄悄更新了
@mh 之前 Family Share 不共享的, 但沒法子, 太便宜了

AG 共享後不知道 Gemini CLI 甚麼樣, 我的用法是先以 Gemini CLI 做計劃及設計 test, 再丟給 AG 的 Flash model 去做, Gemini CLI 的 Pro quota 一天 reset 一次, AG 的 Flash 則 5 小時一次能一直用到盡, USD 20 有這用量還是太便宜了
5 月 18 日
回复了 randm 创建的主题 Google Gemini gemini 昨夜悄悄更新了
Reddit 上也有人討論 Flash 變強了

Antigravity 不更新的原因是我懷疑要一次過在 Google IO 跟新 model 一起推出來
@squarefong17 對, 即使是 DGX Spark 這些小機器, VRAM 足夠但跑 20B 以上的 Dense 模型都太慢, 唯一寄望是 Active 單位數字的 MoE

我本地用兩片 3090 + NVLink, 用 vllm 跑 Gemma4 31B FP8 打開 Tensor Parallel, 吃了 800W 電力才剛剛好有 60 tps
我也認為是 context 長度的問題而不是罵的問題, 一個 chat session 幹活太長會降智把之前做好的東西都改回, 愈小的模型愈有感, 畢竟小模型的注意力比較有限沒能像大模型般全都兼顧
喔我看懂了, 思路是把問題切小, 讓小模型能處理, 一步一步來能讓自我修復

的確, 即使是 Cluade Code 的 context management 比 OpenCode 還是強太多, 以前用 Roo Code 在 4090 上跑 local LLM 基本上 tool calling fail 是基本, 現在用 Qwen3.6 + 5090 會好一點但還是有差

我也來試試用看
Roo code 也不做了, 你現在才開始?
同類型的還有 OpenCode 在做, 中國模型也有首輪適配的, 這輪子不要自己造吧。

不過我建議你用 claude code 配 local model 試試看, llama.cpp 支援 Anthropic API
https://huggingface.co/blog/ggml-org/anthropic-messages-api-in-llamacpp

只要設定好兩個環境變數就能用 claude code, 不用 login 也不怕被 ban
ANTHROPIC_BASE_URL=http://127.0.0.1:8080 claude
ANTHROPIC_AUTH_TOKEN=local
4 月 25 日
回复了 archxm 创建的主题 Local LLM 大伙有想过二次训练吗?
@archxm 早就有了, vast.ai 很多人在用

問題是你所謂的二次訓練, 其實還有分 CPT 及 SFT 的, 一般用 SFT 已經足夠應付任務, CPT 效果不佳而且你之後還是要補回一次 SFT
1  2  3  4  5  6  7  8  9  10 ... 51  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2615 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 30ms · UTC 15:17 · PVG 23:17 · LAX 08:17 · JFK 11:17
♥ Do have faith in what you're doing.