• 请不要在回答技术问题时复制粘贴 AI 生成的内容
yohjisakamoto
V2EX  ›  程序员

反思一下为什么我的开源项目没有做好

  •  
  •   yohjisakamoto · 23h 44m ago · 2217 views
    其实这个事情最开始是 26 年开始有很多号称可以节省 80%-90%token 的项目出来了,比如 RTK, caveman, ponytail.他们都声称可以节约大量的 token ,而且短期获得了几万的 github 收藏。 我之前的创业项目是做面向 e-commerce 的 chatbog ,其实是和 Universal Commerce Protocol (UCP) 一摸一样的一个产品,也是因为 UCP 的发布我没有再继续做这个赛道。今年早些时候,我就想把我们之前搭建 e-commerce chatbot agent 的架构做成 sdk 。简单说这个架构的核心是通过状态机和执行序列把同样任务中 llm 的 provider call 的往返次数减少 80%来降低同样规模的 token 消耗。

    现在的问题是这样的,我很清楚为什么 RTK 这类工具在真正的长任务中是完全无效的。
    我 18 号发布的报告,和 jetbrain 20 号发布的报告基本是同样的观察结果,RTK caveman 这类节省 toekn 的插件在真实长任务中毫无作用:
    https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/
    https://turaai.net/blog#token-saving-plugins-are-mostly-stupid-idea

    我很清楚如何真正做到长任务中 80%+ 的 token 消耗减少。但问题是我在推广我的开源项目中遇到了非常大的困难。我把主要问题总结为 3 点:

    大多数 coding agent 用户,不论是有系统编程技能培训或是没有的所有 vibe coder 其实对真正的 token 消耗的原理理解差异很大。一个系统的讲解具体流程,并且挑战认知的长文章会在这个充满 ai 写作和 vibe coding 写出来的无数可以号称减少 95%token 使用的插件的论坛中显得愚蠢和天然没有传播性。

    简单的才易传播,人不是理性动物,只会相信自己更容易理解的事务。这就是为什么所有社交媒体上错误归因的伪科学永远比讲数学原理的频道有更高的关注度。

    作者的傲慢。这其实是两个问题的结合,在一个相信科学测试方法和 eval 科学的作者眼中。没有 eval 和 benchmark 的软件工程是无意义的。但事实是可能是作者自己的傲慢和对 rtk 这类工具的鄙视甚至是嫉妒造成了他更不愿意用更有效的方式传播他的作品。

    如果大家有时间看到这,可以给我提一些意见,告诉我如何才能在尊重 eval 和 benchmark 严谨性的同时更好的推广我的产品。 我知道用 codex 或者 claude 写一个 coding agent 很简单,但我也相信,总会有人理解 benchmark 和 eval harness 的价值。

    https://github.com/Tura-AI/tura
    目前项目 16 号发布现在 400 多个星,只能算个小透明
    Supplement 1  ·  23h 1m ago
    (重新编辑)

    感谢楼上的反馈。原文是我直接写的,但表达确实比较仓促,很多中英文术语混在一起,读起来不够顺畅。下面重新整理一次,核心问题不变:如何在坚持评测严谨性的同时,更有效地传播一个开源项目。

    利益披露:我是 Tura 的维护者。这篇帖子不是以第三方身份评价自己的项目,而是希望就开源项目的传播方式和评测方法获得坦率的建议。

    从 2026 年初开始,RTK 、Caveman 和 Ponytail 等项目声称可以减少 80%~ 90% 的 Token 使用量。其中一些项目在很短的时间内获得了数万 GitHub Star 。

    我之前的创业项目在做电商聊天机器人。事实上,它和后来发布的 Universal Commerce Protocol ( UCP )几乎相同。UCP 发布后,我决定不再继续这个方向。

    今年年初,我开始把我们为电商聊天机器人 Agent 构建的架构改造成 SDK 。简单来说,它的核心思路是使用状态机和确定性的执行序列,在完成同一任务时,将与 LLM 服务商之间的往返次数减少约 80%,从而显著降低 Token 消耗。

    我非常清楚 RTK 之类的工具为什么在真正的长时间任务中不起作用。我在 7 月 18 日发布了一份报告,JetBrains 在 7 月 20 日发布的报告得出了基本相同的结论:RTK 和 Caveman 这类 Token 节省插件,在真实的长时间任务中几乎没有效果。

    - JetBrains 报告: https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/
    - 我的报告及可复现方法: https://github.com/Tura-AI/tura/blob/main/docs/blog/token-saving-plugins-are-mostly-stupid-idea.md

    我也认为自己知道如何在长时间任务中真正实现超过 80% 的 Token 降低。然而,我发现宣传这个开源项目比构建它困难得多。

    ## 我认为问题出在哪里

    ### 大多数编程 Agent 用户并不关心是什么真正导致了 Token 消耗

    无论是接受过正式软件工程训练的开发者,还是自学的“氛围编程者”,编程 Agent 用户之间都存在巨大的认知差距。

    一篇系统解释运行机制、并挑战既有假设的长文章,在已经充斥着 AI 生成文章和“节省 95% Token”插件的论坛里,很难得到传播。

    简单的观点更容易传播。人并非完全理性,通常更愿意相信容易理解的解释。这或许也是为什么建立在错误因果关系上的伪科学内容,往往比认真解释数学原理的内容获得更多关注。

    ### 作者本人的傲慢

    这可能是两个问题的结合。

    对于一个非常相信科学测试、评测和基准测试的人来说,没有评测支持的软件工程主张可能毫无意义。

    但也许正是我自己的傲慢,以及我对 RTK 等工具的轻视,甚至嫉妒,让我不愿意用真正有效的方式介绍和推广自己的工作。

    如果你读到了这里,我真诚地希望得到你的建议:

    - 如何在不牺牲严格评测和基准测试的前提下,更有效地介绍这个项目?
    - 什么样的证据会让你愿意尝试一个不知名的编程 Agent SDK ?
    - 目前的表达是否过于技术化、过于攻击性,或者选错了目标受众?
    - 我应该如何修改仓库首页或基准测试的展示方式?

    我知道,使用 Codex 或 Claude 构建一个编程 Agent 并不算特别困难。但我也相信,总会有人理解基准测试和评测框架的价值。

    项目于 7 月 16 日发布,目前有 400 多个 GitHub Star:

    https://github.com/Tura-AI/tura

    欢迎批评,包括你不会使用它的原因。
    33 replies    2026-07-26 20:04:56 +08:00
    fructose
        1
    fructose  
       23h 21m ago   ❤️ 1
    这些文字读起来很难受,可能是因为你的母语不是中文,同时没有使用好的翻译工具。
    This text is difficult to read, perhaps because Chinese isn’t your native language and you didn’t use a good translation tool.
    yohjisakamoto
        2
    yohjisakamoto  
    OP
       23h 11m ago
    @fructose ...哥们我是中文写的不至于吧
    gullitintanni
        3
    gullitintanni  
       23h 4m ago
    @fructose #1 有可能是 AI 写的或者润色过的。AI 特别擅长这种语法正确但是读起来难受的长难句。

    母语非中文的作者如果能写成这样,那和母语也差不多了。甚至已经超出中文互联网的平均水平了。
    yohjisakamoto
        4
    yohjisakamoto  
    OP
       23h 0m ago
    @gullitintanni ..不是 20 岁才出国国内读了高中为啥就变成了非中文母语者了
    duuu
        5
    duuu  
       22h 29m ago
    确实是看起来有点难受,其实没有 AI 味,说不出来什么原因
    Googlefan
        6
    Googlefan  
       22h 24m ago via Android
    阅读起来,有一种看机器翻译的感觉
    yohjisakamoto
        7
    yohjisakamoto  
    OP
       22h 19m ago
    @duuu 我问了我室友她说是因为句子太多从句了,像英文不断加从句。
    Deshun
        8
    Deshun  
       21h 50m ago
    声称、早些时候,这些词汇,在我看来就是直接机翻,不可能是中国人写出来的。
    lesismal
        9
    lesismal  
       19h 42m ago
    看不懂,但已 Star 。

    其实专业领域的人面对非专业领域的人在阐述问题时带有较多术语,并且经过良好训练的人讲求逻辑严谨、带很多定语或从句之类的,导致句子复杂,跟考研英语、雅思学术之类的长难句一个道理。
    然后就显得难于理解,不接地气了。这属于正常现象,习惯了学习/学院/学术方式严谨思维的人,想改变到面向市场的思维方式挺难的。这是另一种“聪明反被聪明误”。

    祝 OP 成功!
    xuld
        10
    xuld  
       15h 38m ago
    github 上 readme 的文字不对。

    最外层的标题

    你现在是:

    《 Tura:少 83.1% 的交互轮次,高 16.7 个百分点的成功率》

    改成下面这个,可以提升 star 率:

    《 Tura:一个更快、更省钱的本地 AI 编程助手——免费、开源,减少 83.1% 的交互次数、提高 16.7% 代码生成正确率》

    readme 后面的文章中夹杂着大量的专业术语,那一定会同时给人两种感觉:
    1. 你似乎很专业。
    2. 你似乎在看不起我——连个介绍的文档都不懂——我们不是一路人——江湖再见。

    真正的专家一定是能化繁为简的。

    越是水平高的专家,说的话就越能让人听懂。

    而不是把简单的东西弄的很复杂,显得你很专业、用户很傻逼似
    yohjisakamoto
        11
    yohjisakamoto  
    OP
       12h 37m ago
    @xuld 其实我想听一下我该如何介绍能解释得更清楚。我问过 gpt 他说得解释我反而听不懂
    yohjisakamoto
        12
    yohjisakamoto  
    OP
       12h 33m ago
    @xuld 其实你可能觉得我是傻逼但是 16.7 的百分点是相对于 basline 标准计算的比如对比对象是 60% 我的是 76.7%我准确的说是百分点。 但是如果我说百分比也就是 16.7% 其实我的成绩应该是 10%左右。 我想说的更容易理解,但这很可能导致我说的内容不是准确的。
    yohjisakamoto
        13
    yohjisakamoto  
    OP
       12h 33m ago
    @lesismal 我觉得这是 2 种技能。我完全不具备能说的好理解的这个能力,只能慢慢训练。但是很难。
    GeruzoniAnsasu
        14
    GeruzoniAnsasu  
       12h 28m ago
    我不用是因为我想完成自己的 agent project (

    你需要一个简明的报告来指出
    - tura 用到的优化方法
    - 优化方法的效果。

    比起项目介绍我的私心其实更想知道 agent token 消耗的分布是如何 benchmark 的,在哪有工具和数据可以查看/分析;从我日常的直觉来看深度任务的反复返工是最要命的——设了一个过远的目标,缺乏局部 greedy 效果跟踪,导致消耗了大量 reasoning 输出后得到了一个不完全符合本意的结果。

    假如你发明了某种技术,能通过实验证明能通过强力精准的剪枝把这些预期外尝试消除,那么这个技术本身就是最好的推广主体和宣传点,而你的项目只不过是该技术的一个验证,以及(比别的想复现的人更进一步地)产品化。




    另外行文没什么大问题没必要听天天对着 LLM 的破碎中文语言能力都退化了的人瞎指点语法结构,让「语言模型教人类语言如何建模」才是最黑色幽默的讽刺。我甚至很多时候都会故意用长句子来回复。
    xuld
        15
    xuld  
       12h 20m ago
    @yohjisakamoto 不需要“准确”!甚至你都可以不要数字,直接用“很多”,“超过一倍”这样的描述。

    我知道你在项目里花了很多心血,想要诚实以对,但问题是用户并不关心你有多努力,也没人会在意你说的准不准,用户只关心他自己,他需要在 3 秒内判定这个项目能不能为它所用,然后马上关掉页面。

    你的真实用户,3 秒内看不出这个项目的价值,其实都流失了。

    不要看你现在关注的人还多,我敢说他们大部分不是你的用户,他们的真实意图是:“想把你的东西抄成他们自己的,关注后以后有时间慢慢研究”。因为只有这样的人,才会愿意看你这么多“专业”的废话
    sir283
        16
    sir283  
       11h 33m ago
    比我好多了,我不走偏门,只做工具,完全没啥人关注。

    这是我主页: https://github.com/MrsEWE44
    asmallcake
        17
    asmallcake  
       11h 16m ago
    @yohjisakamoto 我发了一个帖子,也被怪中文语法,我自己又重新阅读了好几遍,结果觉得还好。
    yohjisakamoto
        18
    yohjisakamoto  
    OP
       10h 58m ago
    yohjisakamoto
        19
    yohjisakamoto  
    OP
       10h 56m ago
    @xuld 我觉得这样就没差异化了,和 rtk 这些牛逼吹上天的就没区别了。我觉得 vibecodidng 这么多还是要有点差异化。你可以看下我上面帖子里的 jetbrain 的文章。基本跟我是一个风格的,我觉得差异性也是个挺重要的原因。
    wha582
        20
    wha582  
       8h 18m ago via Android
    想问一下,
    tura 是如何处理 schema 重试的,
    patch 复杂 markdown 的时候格式出问题的概率大吗,
    另外代码里有强制 dsl 输出的 command 数量吗,不强制会怎么样,
    此外试过只给一个单纯的 seq(按序执行 command) 看看效果如何吗
    (话说回来 DeepSeek 测试过吗)
    menfrexu
        21
    menfrexu  
       7h 22m ago
    感觉比我强太多了,我一个编辑功能优化了好久都没优化好,可以看看我的 https://github.com/Menfre01/waveloom 指点一下
    coala
        22
    coala  
       6h 15m ago
    啊 看的真的很难受。

    比如排版问题
    ❌ :节省 80%-90%token 的项目
    ✅ :节省 80%~ 90% Token 的项目

    比如主谓宾问题

    ❌ 一篇系统解释运行机制、并挑战既有假设的长文章,在已经充斥着 AI 生成文章和“节省 95% Token”插件的论坛里,很难得到传播。

    ✅ 论坛里充斥着 AI 生成的文章和"节省 95% Token"的插件。
    在这样的环境里,一篇系统解释运行机制、挑战既有假设的长文,
    很难传播出去。

    感觉真的怪怪的,不像中文。
    coala
        23
    coala  
       6h 10m ago
    感觉在用英文的逻辑写中文。
    coala
        24
    coala  
       6h 2m ago
    和 ai 聊天 发现个好玩了,op 用普通话读一下,英文主谓宾舌头打结 233333
    yasinDoyle97
        25
    yasinDoyle97  
       5h 34m ago
    没接触过这类产品,看了 github 的感受是,不像是产品介绍,像在读论文,中文 readme 第二段已经看得很费劲了,又是数据又是破折号对比,你要做的是产品推广不是技术说明书。“少 83.1% 的交互轮次,高 16.7 个百分点的成功率”这样的数据,完全可以用更快,更省来表达。只介绍你的优势,让用户快速用起来才是最重要的,不用花大篇幅介绍你是怎么做的,也许你是想提现数据严谨,你可以将对比这部分放在篇幅末尾。readme 按照优势介绍-quick start-技术说明 这个的结构来写也许会好一点。希望对你有帮助。
    penguinWWY
        26
    penguinWWY  
       5h 7m ago
    专门上号吐槽一下,你的中文 README 中基准测试那一节,开头这句:
    长周期任务基准测试是看透精心打磨的孤立提示,了解代理如何处理真实工作的一种方式。

    这句话的断句应该是:长周期任务基准测试 / 是 / 看透精心打磨的孤立提示,了解代理如何处理真实工作 / 的 / 一种方式

    那中间这个不应该是顿号吗?逗号把这句话拆分成前后两部分,导致第一眼就没看懂,“长周期任务基准测试是看透精心打磨的孤立提示”?

    另外当我想帮你改写这句话的时候发现“看透精心打磨的孤立提示”这个太模糊了,看透的到底是什么?很困惑。我猜测你是想说目前框架中这些孤立的 prompt 到底对模型的正确性起到什么样的作用?

    不如直接说:为了准确体现代理的真实工作逻辑,我们以长周期任务作为基准测试。
    andrewsetsu
        27
    andrewsetsu  
       3h 21m ago
    楼主我觉得你的明显一个问题就是把简单的问题表达的很复杂,以至于读者难以看明白。就算项目很好,不知道你在说啥,那也很难吸引使用者。
    yohjisakamoto
        28
    yohjisakamoto  
    OP
       2h 24m ago
    @wha582 patch 最大的问题是一般工具会把 patch 分段放在一个执行 command 里,单一部分失败一般就整个崩了。tura 的 patch 会被拆分成每一段修改一个 cli 命令。正常情况下 step 1 打 patch ,step 2 build ,step 3 跑测试,step 4 读 log 。 但是如果 patch 中有 exit 1 或是其他错误,执行器会 abort 整个 llm call 。并记录执行过的成功 patch ,然后把中间态记录在 session log 中。立刻重新启动新一轮的 provider call ,把中间态和上一回合 patch exit 错误原因回填给 provider 。这样如果 Cc 或者 codex 整个补丁都会挂重头写,tura 一般只需要重写一小段。
    yohjisakamoto
        29
    yohjisakamoto  
    OP
       2h 15m ago
    @penguinWWY 这个,起码在英文原版中是想说,通过 eval 和 benchmak 作孤立的提示词和单元修改对整体 benchmark 成绩的影响来判定是否留下或者改变某个提示词或者架构设计。 你可以理解为把 provider 的行为想象成一个非确定性的生物系统。通过设计实验和观察来判定某些局部环境和输入的改变对输出的影响。

    就比如说我研究土豆养殖,2 个分组,用同系的 200 苗株,100 每天浇水 4 次,另一组每天浇水 2 次。观察产量变化。如果一个组的收成更好,则把他的浇水方式引入系统。

    就像 patch 的例子,我通过独立的完整的 benchmark 任务来测试是通过提示词和 cli 中的某个参数该如何设计。得出的结论就是在统计后,现有方案是测试模型和测试类型任务的最优解,这也是大概率的我能找到的目前的全局最优解。 我其实想说的是在构建一个复杂系统的时候,正确的做法是通过模拟 benchmark 来作某种程度的梯度下降,来衡量设计决定以及参数是否帮助构造最优解。
    yohjisakamoto
        30
    yohjisakamoto  
    OP
       2h 12m ago
    @wha582 目前通过 schema 限制 5-15 组命令,每个命令的长度和 step 也有限制。但是我没开 strict schema 。所以就看 llm 自觉。经过测试这是最优的配置。用 schema 和提示词但不 strict 。大部分情况会把所有能并发和串行的全部一次输出。1-3 次能解决的简单任务比如查询时间也能不输出无意义指令。在 kimi ,deepseek ,gpt ,minimax 上都有类似的效果。
    yohjisakamoto
        31
    yohjisakamoto  
    OP
       2h 12m ago
    @menfrexu 具体有啥问题吗哥们
    yohjisakamoto
        32
    yohjisakamoto  
    OP
       2h 10m ago
    @coala 这个原来的版本可能有编辑的小问题,但我觉得大家说的不是这些小问题。是根本的行文和修辞,甚至是表达问题。我也发现了这个问题,但是我发现真的很难改。这其实是语言习惯,就像很多人打中文不加标点符号一样。但是我觉得你说英文逻辑就有点夸张了。我写的时候完全是按中文逻辑写的,头脑中的思绪也是中文。 我自己写的时候读的其实听通顺的。。。
    FrankFang128
        33
    FrankFang128  
       Just Now
    [tura postinstall] platform package tura-darwin-arm64 is unavailable; reinstall tura-ai with optional dependencies enabled after confirming [email protected] is published
    ____
    macos iTerm2
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2823 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 52ms · UTC 12:05 · PVG 20:05 · LAX 05:05 · JFK 08:05
    ♥ Do have faith in what you're doing.