ndxxx

ndxxx

V2EX member #580231, joined on 2022-05-07 09:34:03 +08:00
Today's activity rank 3987
Per ndxxx's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
ndxxx's recent replies
1h 45m ago
Replied to a topic by mmdbn 生活 发个相亲很无语的吐槽
哈哈,这帖子的回复里少了个东西,女拳王 D 姐为何还不来锐评一下😁
@QS0x01 哈哈哈哈,老心,你扎铁了🤣
先不论真假,人赚不到认知以外的钱,这句话的含金量还在上升。

直播带货第一是不稳定收入,第二赚钱在郑州花了 220w (大概率全款)买房了。

所以赚钱在哪里?在我这相当于带货至今净赚 负 60 万🤣
1 day ago
Replied to a topic by DiKaErJi AI Agent 智能体 各位 Pi 选手转 dsh 了吗
@ndxxx 问题 -> 文本
1 day ago
Replied to a topic by DiKaErJi AI Agent 智能体 各位 Pi 选手转 dsh 了吗
@DiKaErJi 编辑文件的方式,就是复刻 omp 的那个问题替换范式
1 day ago
Replied to a topic by DiKaErJi AI Agent 智能体 各位 Pi 选手转 dsh 了吗
@DiKaErJi hashline-readmap 这个你有在用吗
1 day ago
Replied to a topic by DiKaErJi AI Agent 智能体 各位 Pi 选手转 dsh 了吗
pi 你用的那些插件
@Dwayne 楼主前女友冒出这个一两百万这句话直接让我绷不住笑了,小仙女小红书没少看🤣
社区消融实验揭秘:DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力

DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案:

V4 Pro 对首轮请求中可见的 API 工具目录( Schema Surface )极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me...” 思维链( CoT )轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need...” 推理轨迹,基准分回升至 9699 分。

针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call ,立即在后续轮次解锁全部 25 项标准工具。

在 Windows 原生 Project2 测试中,该方案连续跑出 98 、99 的高分,成功进入 Fable 等前沿模型分数带。该实验表明,V4 Pro 的核心能力并未丢失,但可能在强化学习( RL )后训练阶段对特定的 Harness 脚手架与工具暴露环境存在显著过拟合。

参考:microblock_pub 、DeepSeek V4 Pro / Flash 轨迹触发机制实验 、dsh-anchored-standard


DSH 其实就是 deepseek 新模型重要的一个训练工具。另外也相当于官方告诉你这个东西就是他家的官方 harness 骨架。个人开发者拿什么背书这些东西呢😅
3 days ago
Replied to a topic by majuzhang Local LLM 公司本地部署开源模型
@zsj1029 那这个成本还是挺高的😂
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4535 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 832c8fa1 · 23ms · UTC 10:06 · PVG 18:06 · LAX 03:06 · JFK 06:06
♥ Do have faith in what you're doing.