Q
DeepSeek Harness的投研案例实测效果如何?
A
综合五类案例测试,DeepSeek Harness 能够通过 Skills 调用绘图、信息检索、个股分析和基金评价等专业能力,并支持多智能体协同完成复杂投研任务。在流程图生成、arXiv 论文整理、个股基本面分析、基金产品评价及医药行业研究等场景中,系统均可根据自然语言需求匹配相应 Skill,并输出结构化数据、分析报告、图表或网页看板等成果。
其核心特点在于运行轨迹可完整记录任务拆解、模型响应、工具调用和结果生成过程,便于对分析路径、数据来源及异常处理进行复核与追溯。与 WorkBuddy 相比,DeepSeek Harness 在任务执行过程的透明度、技能复用和系统定制化方面更具优势,适合具备一定开发能力的团队构建专业投研工作流;WorkBuddy 则在图形化交互、连接器生态和开箱即用体验方面更为友好,适合希望快速开展日常投研任务的用户。
Q
DeepSeek V4 Pro三类金融投研任务实测效果如何?
A
以估值建模、多因子回测和行业研究三个真实投研任务,对DeepSeek V4 Pro、Kimi K3和GLM-5.2三个模型进行了实测。估值任务中,Kimi K3排名第一,其收入预测按"分产品销量×单价"拆解,颗粒度最细,报告结论与目标价、评级一致;DeepSeek V4 Pro排名第二,报告口径更新、结论审慎,但Excel关键公式存在系统性错位,修改假设后无法可靠重算;GLM-5.2排名第三,工作簿核心公式异常、结论无法复核,存在明显冲突。
回测任务中,DeepSeek V4 Pro排名第一,扣除交易成本、明确区分信号日与执行日并剔除停牌,底稿完整、可逐期复核;Kimi K3排名第二,交付较完整,但未扣成本、未区分交易时点、未处理不可交易状态,高换手下收益可能被明显高估;GLM-5.2排名第三,毛净收益完全相同,相当于未扣成本,中间过程披露不足。
行业研究任务中,DeepSeek V4 Pro排名第一,投资框架可复算,Wiki沉淀了来源页、实体页与综合页,关键数据可追溯;Kimi K3排名第二,评分框架完整但Wiki沉淀不足;GLM-5.2排名第三,知识库覆盖面最大,但缺少评分权重与计算方法,结论无法还原,可核实性最弱。总体来看,三个模型在预测颗粒度、底稿可复核性、交易约束处理和来源追溯等方面仍存在明显差距。
Q
DeepSeek V4 Flash在金融投研任务中表现如何?
A
估值建模方面,DeepSeek V4 Flash底稿的可复现较好,但其以增速驱动收入的预测逻辑,在可信度上略逊于Kimi K3。Kimi K3采用“销量×单价”预测收入,报告逻辑基本自洽,但底稿缺少联动,部分公式错误影响数据复核。GLM-5.2的底稿存在多处公式异常,目标价与投资评级也出现逻辑冲突,表现相对较差。
多因子回测方面,DeepSeek V4 Flash使用历史实际成分股与历史行业分类,并且是三个模型中唯一扣除交易成本、剔除不可交易个股的模型。Kimi K3保留了Python代码、每期选股、组合收益和净值等结果,计算过程的可检查性较好,但没有明确区分信号日与执行日,也未完整处理交易成本和不可交易状态。GLM-5.2覆盖区间较长,但同样存在交易时点和交易约束问题,中间计算过程的披露也相对不足。
行业研究方面,DeepSeek V4 Flash的公司数据库覆盖最全,也是唯一保留原始资料层且无断链的模型,但知识库页面最少、各页之间缺少引用。Kimi K3的报告和投资框架较为完整,但同样存在Wiki内容沉淀不足的问题。GLM-5.2覆盖公司也较多、展示效果较好,但投资框架分析逻辑不够清楚,来源管理和内部链接也不完整。
Q
GLM-5.2评测效果如何?
A
编程能力层面,GLM-5.2 在Code Arena全球前端开发盲测中居可用模型第一,支持多档思考强度灵活调节;同评测口径下,多数编程与长程任务指标领先DeepSeek-V4-Pro。架构端通过IndexShare索引共享、MTP推测解码优化等技术创新,1M 上下文下单 token FLOPs 降低约2.9倍,长序列推理吞吐较前代大幅提升。
在金融领域专项评测中,GLM-5.2展现出顶尖的中文金融文本理解能力。基于CFLUE金融应用评估数据集的测试显示,其在金融文本分类、信息抽取、阅读理解等任务上表现优异,整体优于多数国产及海外主流大模型。针对 Parquet 金融数据分析、研报网页爬虫、A 股择时回测框架三类典型投研任务的实测表明,GLM-5.2可实现端到端工程交付,具备突出的任务意图识别与深度数据洞察能力,代码工程完成度高,能有效减少人工干预、提升落地效率。综合来看,GLM-5.2兼顾长程任务稳定性、工程编码能力与金融语义理解能力,可作为复杂AI Agent任务的优选基座模型。
Q
Hermes Agent赋能金融投研应用实测效果如何?
A
基于阿里云无影云电脑部署的Hermes Agent与OpenClaw环境(底层模型均为MiniMax M2.5,数据源为研报数据库与Tushare Pro金融数据接口),通过两个对比案例验证两者在实际投研任务中的能力差异与互补空间。
一是卖方研报观点总结能力对比:要求两者从研报数据库检索一周内26篇红利相关报告并输出结构化市场观点总结,Hermes在1轮交互内自动发现数据库工具并完成全流程,自主将报告归为4个类别后提炼出4项共识与3项分歧;OpenClaw经5—6轮交互完成数据获取,但在分析深度上表现更优——归纳出4项共识与4项分歧,综合研判包含4条可操作的配置建议。
二是个股投研分析与技能沉淀能力对比:要求两者对宁德时代(300750.SZ)进行五维度投资价值分析、将流程封装为可复用技能、再对中信证券(600030.SH)复用技能执行同样分析。Hermes完成"分析—创建—复用"三阶段闭环累计3轮交互,技能复用后两只股票的报告格式完全一致;OpenClaw累计10—11轮交互,技能创建需用户推动落盘,但最终生成的技能文件包含标准化命令行接口,工程规范性较强。
Q
Hermes Agent与OpenClaw之间替代关系如何?
A
从实测结果看,Hermes Agent与OpenClaw并非简单替代关系,而是在执行效率与分析深度两个维度上形成互补:Hermes以闭环学习与自主技能创建为核心,在执行效率、环境适应与技能自动沉淀层面具有优势,适配需要高频产出与持续迭代的专业场景;OpenClaw依托ClawHub社区技能生态实现能力的快速扩展,其优势集中体现在分析颗粒度与研究深度,Hermes官方提供的一键迁移工具支持将OpenClaw已有的技能文件、记忆数据与API密钥等统一迁移至Hermes环境。
Q
CoWork类工具金融投研案例评测效果如何?
A
基于CoWork协同环境,搭配Claude Financial Service Plugins金融服务插件与国金证券专属投研增强模板,完成从日常投研跟踪到深度研报输出的全流程实战验证,核心成果覆盖三大维度:
一是实现高频日常投研事务自动化提效,借助金融插件的标准化能力,在个股跟踪场景完成核心跟踪要点与风险预警提炼,替代了人工逐条筛选整理的繁琐工作,在盘前晨报生成场景实现全流程标准化输出,压缩至分钟级完成,大幅降低日常投研的人工成本;
二是完成专业金融建模对机构需求的深度适配,在原生金融插件仅能提供的基础建模骨架之上,叠加机构自有投研框架,明确分析逻辑、业务拆分维度与输出规范,实现了标的全维度财务指标拆解、行业对标与科学盈利预测;
三是实现机构级研报全流程自动化生产,通过CoWork工具对接Wind、Alpha派、全市场券商研报数据库等专业数据源,完成底层投研数据的自动化抓取、清洗与结构化整合,再叠加机构标准化研报模板,可实现从业绩事件点评、重大事项解读到深度研究报告的全流程生成,完整覆盖业绩复盘、经营亮点拆解、盈利预测、投资评级、风险提示等核心模块,配套完整的财务数据与可视化图表


VIP复盘网