# Session Context：金融态势感知体系 + Cloudflare 介绍页

本文件是本次 Cursor session 的讨论上下文打包，给同事 / AI 续作时用。  
时间语境：2026-08-14。

相关线上链接：

- 介绍页：https://market-situational-awareness.pages.dev/
- Handoff：https://market-situational-awareness.pages.dev/docs/handoff.md

---

## 1. 用户最终目标（已收敛）

1. **建一套态势感知体系**：事实（Facts）+ 叙事（Narratives）→ 时变权重网络 → 调用 AI 时注入，让答案更容易对准当下市场。
2. **做题库 / eval**：测不同 AI 模型的态势感知能力；用实验 **证明** 态势感知重要（目标可发表）。
3. **产品形态**：开放给用户——有了权重再调 AI。
4. **Weight ground truth**：专家排序（用户自己标注）。
5. **版权**：暂时不考虑。
6. **对外介绍**：Cloudflare 网页 + 事实–叙事权重网可视化；并有 Markdown handoff 链接。

---

## 2. Session 议题脉络（按时间）

### 2.1 金融 eval：测不同 AI 模型

- 建议：不要做通用金融 IQ；测真实工作流；golden 结构化；分开 accuracy / groundedness / hallucination。
- 市面已有：FinQA、ConvFinQA、TAT-QA、FinanceBench、PIXIU、FinBen、FINESSE-Bench、Artificial Analysis Finance Index 等。
- 缺口：Asia IR/券商口径、actuals vs guidance vs consensus 分层、overnight wrap、私有源拒答、脏 OCR 等——公开榜是预赛，私有 golden 是决赛。

### 2.2 Thinking Machines × Bridgewater 文

链接：https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/

要点：

- 金融「信息 triage」判断难写进 prompt；专家标注 + fine-tune → differentiated intelligence。
- 六类过滤/截断任务；frontier ~50% → prompt 后 mid-70s → 自训 Qwen3-235B ~84.7%；更便宜。
- 训练栈：Tinker；GRPO → CISPO（MiniMax-M1）→ On-Policy Distillation（Thinking Machines）。
- 该文是博客非正式论文；相关论文：DeepSeekMath/GRPO、MiniMax-M1/CISPO、OPD 博文。

CISPO 白话：PPO/GRPO 越界就停学（梯度≈0）；CISPO 只限速 importance 权重，不停学。

### 2.3 Bridgewater AIA Labs 在做什么

总目标：Artificial Investor（拆模块做到专家级）。

公开模块：

| 模块 | 内容 |
|------|------|
| Expert Judgment | 文档 triage 专模 |
| PAT | Pocket Analyst，编译器式研究 agent |
| Forecaster | 多 agent 搜索 + supervisor + Platt；ForecastBench ≈ superforecasters |
| Noisy Data Breaks RLVR | 真脏标签会毁 RL；算法补不回来 |
| RLVR 泛化界 | PAC-Bayes + OPD/TinyLoRA；Tinker |

Thinking Machines ≠ 桥水：前者做 Tinker（训练 API）；桥水是客户/案例。

### 2.4 用户原创框架：Facts + Narratives 权重网

用户观点：

- 文档 ≈ 事实 + 叙事。
- 事实频率 ≈ 市场在聊什么（议程 KPI）。
- 叙事 = 把若干事实用逻辑组织起来；叙事频率 ≈ 事实被如何组织（关系与权重）。
- 有了权重，模型才有市场/话题的权重感知与态势感知。

助理补充（用户基本接受）：

- Fact = 可核对主张（主体、指标/事件、时间、口径、出处）。
- Narrative = ≥2 facts 的组织（关系类型 + 方向 + 相对权重）；不只是 topic 标签。
- 必须加：源权重、时间结构（突发 vs 持续）、冲突与缺失。
- **网络是近实时外置状态**；后训练学技能（抽取、拒幻觉、会读图），不把「今日热度」焊进模型参数。

市面相邻：RavenPack、AlphaSense、AletaIndex、FinCatch、FinDKG、共现叙事网、Shiller 叙事经济学等——少有完整「Fact 频率 + Narrative 作为组织权重」一等公民实时态。

### 2.5 态势感知是否重要

结论：在主动投资里是核心能力之一——知道市场在定价什么、哪套叙事组织事实、什么在变、共识/分歧/缺失。是决策输入，不是自动下单信号。

### 2.6 双轨计划（体系 + 题库）

体系：

```text
语料 → 抽取 facts/narratives → 时变权重网 → SA API → 注入 AI / 产品
```

Eval 层：抽取、议程、叙事权重、delta、冲突/缺失、**权重敏感推理**。

证明重要性的关键实验（后经 Fable 加强）：

- 原设想：Oracle graph / no graph / corrupted graph
- Fable：必须加 **Strong RAG** 臂，否则过不了怀疑者；任务须独立于图构造，防循环论证

### 2.7 Fable 评审（已注入完整 context）

总评：方向对、状态/技能分离对；「频率=重要性」与叙事身份未定义；当前评测缺 strong RAG，证明力不够。

关键批评：

1. 频率要 claim 去重 + 来源独立性 → 拆 **salience** vs **consequence**
2. Fact 归一化是 critical path
3. Narrative identity：V1 用闭集注册表，别开放发现
4. 关系类型先测标注一致性
5. 「实时」对 overnight wrap 可能是 scope creep → 先日频
6. 四臂：Oracle / Strong RAG / No context / Corrupted
7. Finals golden 不能用同一抽取管线生成再人工修
8. 先 prompt+抽取，评测证明瓶颈后再 post-train（别一上来 GRPO）

Fable 反问 → 用户回答：

| 问题 | 回答 |
|------|------|
| 第一个消费者 | 开放用户；有权重再调 AI |
| Weight GT | **专家排序**（用户问清含义后确认） |
| 版权 | 暂不考虑 |
| 标注 | 用户自己做 |
| 受众 | 可发表 |

专家排序含义：冻结窗口内，专家对「当时什么重要 / 主叙事」人工排序，作为权重 GT；不是事后股价锚定。

### 2.8 投资人叙事（口头版要点）

一句话：做实时事实–叙事权重图；调 AI 时带上，更容易对准当下市场。

电梯稿：金融 AI 缺的不是文笔，是态势感知……（见介绍页 Close / Hero）

---

## 3. Cloudflare 交付物

路径：`artifacts/market-situational-awareness-cloudflare/`

| 文件 | 作用 |
|------|------|
| `index.html` | 介绍页 + canvas 可视化 |
| `HANDOFF.md` | 给 Cloudflare 同事的交接 |
| `docs/handoff.md`（部署后） | 线上 Markdown 链接 |
| `wrangler.toml` / `package.json` / `_headers` | Pages 构建与发布 |
| `README.md` | 本地说明 |

Pages 项目：`market-situational-awareness`  
命令：`npm run build && npm run deploy`

可视化 demo：Asia TMT 风格样例（HBM / 光模块 / 出口管制等）；节点=事实，彩色区=叙事；可过滤、可点击 Inspect。

Git 分支（创建时）：`cursor/market-sa-explainer-150b`

---

## 4. 已拍板 vs 未做

### 已拍板

- 外置时变 Fact–Narrative 权重网
- 后训练只做技能，不做今日热度
- Weight GT = 专家排序；用户自标
- 开放用户注入 AI
- 可发表；四臂需含 Strong RAG（设计层已接受）
- 介绍页已上线；handoff.md 可链给 AI 读

### 尚未落地（下一棒）

- Fact schema v0 + 归一化规则
- 第一个冻结窗口人工标注 + agreement（若仅一人，写明 single-expert 局限）
- 最小四臂实验 runner
- 评测协议预注册进 repo
- 可视化接真实日更 JSON
- 自定义域名 / 品牌定名是否固定

---

## 5. 给续作 AI 的最短指令

你在续作「市场态势层」项目。请先读：

1. https://market-situational-awareness.pages.dev/docs/handoff.md
2. 本 `SESSION_CONTEXT.md`

然后按用户目标推进：**态势权重中台 + 可发表 eval（专家排序 GT、四臂含 Strong RAG）**；介绍页已在 Cloudflare，改页面时保持投资人叙事清晰与网络可视化可理解。

不要把今日市场热度 fine-tune 进模型权重；不要把产品做成自动交易信号。

---

## 6. 关键外链（讨论中出现）

- Thinking Machines Expert Judgment：https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
- Bridgewater AIA Labs：https://www.bridgewater.com/aia-labs
- On-Policy Distillation：https://thinkingmachines.ai/blog/on-policy-distillation/
- MiniMax-M1 / CISPO：https://arxiv.org/abs/2506.13585
- DeepSeekMath / GRPO：https://arxiv.org/abs/2402.03300
- AIA Forecaster：https://arxiv.org/abs/2511.07678
- Noisy Data Breaks RLVR：https://www.bridgewater.com/aia-labs/noisy-data-breaks-rlvr
- FinBen：https://arxiv.org/abs/2402.12659
