Design a multilingual alignment plan (zh/ja/hi/id/pt/en): shared subword policy, cross-lingual instructions, and locale-specific refusal tuning. Provide leakage checks.
Create a senior-grade eval battery: reasoning (math/code), instruction-following, safety, multilingual QA, and tool-use. Include uncertainty intervals and power analysis for A/Bs.
Design a tool-use curriculum: function signatures, schema discovery, tool reliability scoring, and retry/backoff policy. Include sandboxing and cost guards.
Create a hallucination detector using entailment+attribution signals. Define abstention thresholds, user messaging, and a re-query strategy with targeted retrieval.
Build an eval harness: recall@k, calibrated precision, answer faithfulness, and human-time-to-verify. Include topic-aware test buckets and data drift alarms.
Architect a retrieval stack with hybrid search, temporal decay, dedup, and passage-level citation anchors. Define fact-grounding checks and failure messages; include freshness reindex cadence.
Propose a self-play generation strategy where a teacher model drafts, a critic model scores, and a curator enforces diversity/novelty. Provide leakage and drift monitors.
Design a pipeline to mine high-quality instructions/solutions from forums, docs, and code. Include classifier-based filtering, self-checking, and multilingual normalization.
Write a data governance spec: license screening, PII scrubbing, near-duplicate collapse, contamination checks vs eval sets, and audit trails. Provide rejection reasons and exception handling.
Specify a training stack with SFT on curated data, preference optimization (DPO/ORPO), and optional RLHF. Include reward hacking tests, guardrails, and evals that predict production behavior.