AI Startup 面试准备指南:Glean、Perplexity、Harvey、Scale AI 都在考什么
面向北美华人候选人的 AI startup 技术面试准备指南:Glean、Perplexity、Harvey、Scale AI 常见 coding、OOD、system design、LLM product infra、project deep dive 和 behavioral 准备方法。
近两年很多北美华人候选人开始把目标从传统 FAANG 扩展到 AI startup,比如 Glean、Perplexity、Harvey、Scale AI 这类公司。它们的面试和大厂很不一样:流程更快,题目更贴近产品,coding 更 hands-on,system design 更偏 search、recommendation、agent workflow、document permission、LLM pipeline。
如果你用传统 LeetCode + 通用 system design 模板准备,很可能会觉得这些面试“题不难,但很怪”。真正考点不是背题,而是能不能快速理解一个 AI product 的工程约束:数据怎么进来,权限怎么控制,检索怎么做,LLM 怎么接入,延迟和质量如何权衡,失败时怎么恢复。
这篇文章会把 Glean、Perplexity、Harvey、Scale AI 这类 AI startup 的面试抽象成几类能力,帮助你更系统地准备。
AI startup 面试的共同点
这些公司业务不同,但面试有一些共性。
Coding 更像小型产品功能。
你可能遇到 memory file system、folder / file command parser、chess OOD、CSV parsing + endpoint、document processing pipeline、DFS 或 graph traversal。题目不一定是难算法,但需要快速建模和写出可运行代码。
System design 更贴近 AI 产品。
Perplexity 可能问 discovery feed、trending queries、personalized recommendation。Harvey 可能围绕 Google Drive-like document system 和 ACL。Scale AI 可能问 classification / embedding pipeline、low latency 和 high throughput。Glean 可能关注 enterprise search、document permission、knowledge retrieval。
Project deep dive 更看业务影响。
小公司不会只看你会不会背标准答案,它更关心你能不能独立负责一个复杂模块,能不能把产品和技术连接起来。
面试节奏更不稳定。
有的流程很快,有的轮次临时变化,有的题更开放。候选人需要适应不确定性。
Coding:从 LeetCode 转到 Hands-on Engineering
AI startup coding 常见题型包括:
- in-memory file system
- command parser / mini shell
- OOD design chess or game logic
- CSV / JSON parsing and API endpoint
- folder / file hierarchy
- DFS / graph traversal
- data transformation pipeline
- LLM API wrapper 或 classification workflow
这些题不一定难,但很容易因为细节挂掉。
Memory File System 怎么准备
如果题目是 file system,不要只背 LeetCode 原题。很多变种会要求你解析命令式输入,比如类似 Unix command 的字符串,然后执行 mkdir、ls、cd、touch、write、read、find。
准备重点:
- path normalization:
.、..、多余/ - directory 和 file 的区别
- trie node 或 tree node 的数据结构
- command parsing 和 error handling
- 当前工作目录状态
- list 输出顺序
- deep nested path 的性能
- search by name 或 content 的扩展
好的代码结构通常会把 parser、filesystem model、command executor 分开。这样 follow-up 加新命令时,不会把主函数写爆。
OOD 题怎么准备
Glean 等公司可能出现 chess、game、article system 这类 OOD。不要一上来写一堆 class。先定义行为:
- 系统支持哪些操作
- 谁调用这些操作
- 状态如何变化
- 哪些规则需要验证
- 哪些规则未来可能扩展
以 chess 为例,你不需要现场实现完整国际象棋引擎,但你需要设计清楚 board、piece、move、rule validator、game state、turn、win condition。面试官更看你如何管理复杂规则,而不是类名是否优雅。
AI Product System Design:不要只讲 LLM API
很多人准备 AI startup system design 时,会把答案简化成“调用 OpenAI API”。这通常不够。
一个真实 AI product system 至少有这些层:
| 层次 | 需要考虑的问题 |
|---|---|
| Data Ingestion | 文档、网页、用户事件、第三方数据如何进入系统 |
| Permission | ACL、workspace、tenant、role、document-level access |
| Indexing | chunking、embedding、metadata、incremental update |
| Retrieval | keyword search、vector search、hybrid ranking |
| Generation | prompt construction、context window、citation、guardrails |
| Feedback | click、save、thumbs up/down、human review |
| Observability | latency、quality、hallucination、retrieval hit rate |
如果你面的是 Glean 或 Harvey,permission 是高频重点。企业搜索和法律文档系统不能把没有权限的文档喂给模型。你要能讲清楚:
- ACL 在 ingestion 时过滤,还是 query time 过滤
- permission changes 如何同步到 index
- deleted document 如何从 search result 和 embedding index 移除
- multi-tenant isolation 怎么做
- audit log 如何记录用户访问
如果你面的是 Perplexity,重点可能更偏 discovery、trending、personalized ranking。你要会讲:
- query log 如何聚合
- trending queries 如何去重和防 spam
- personalization 信号怎么收集
- cold start 怎么处理
- feed ranking 如何平衡 freshness、relevance 和 diversity
如果你面的是 Scale AI,题目可能更偏 data pipeline、classification、embedding service、human-in-the-loop。你要讲:
- 文件上传 API
- batch vs single request
- low latency 和 high throughput 的分层
- async job queue
- model service timeout 和 retry
- human review queue
- evaluation 和 quality monitoring
LLM Pipeline 设计的核心 trade-off
AI startup 面试里常见的追问不是“你会不会用 RAG”,而是 trade-off。
Latency vs Quality。
检索更多 chunk 可能提高召回,但增加延迟和 token cost。reranker 提升质量,但会增加服务调用。
Freshness vs Indexing Cost。
实时同步文档可以保证新鲜度,但写入压力和 permission invalidation 更复杂。批量更新更便宜,但搜索结果可能滞后。
Personalization vs Privacy。
个性化需要用户行为数据,但 enterprise 场景要谨慎处理隐私、权限和审计。
Automation vs Human Review。
自动分类或生成可以提高效率,但高风险场景需要人工审核、confidence threshold 和 fallback。
面试时你不需要把每个系统设计得很大,但必须说清楚你选择的边界。
Project Deep Dive:小公司更关心你是否能独立推进
AI startup 的项目深挖通常会问:
- 你具体负责哪部分
- 为什么这个项目对业务重要
- 你如何衡量效果
- 遇到过什么技术难点
- 如果用户量增加 10 倍怎么改
- 如果模型输出质量不稳定怎么办
- 你如何和 product / research / data team 合作
准备时建议选一个最能体现 ownership 的项目,不要选一个只参与边缘功能的项目。最好能讲出:
- 从问题定义到上线的完整链路
- 一个关键技术判断
- 一个踩坑或事故
- 一个量化结果
- 一个你会重做的地方
Behavioral:AI startup 想听到什么
这类公司通常更看重:
- ambiguity tolerance
- fast iteration
- ownership
- product sense
- customer empathy
- willingness to learn
- ability to debug unfamiliar systems
华人候选人容易把 behavioral 准备成“我很努力、我很配合”。这不够。你要展示自己在不确定情况下如何推进事情。
可以准备 5 个故事:
- 需求很模糊但你推动落地的项目。
- 线上系统出问题,你如何定位和修复。
- 和 PM / researcher / customer 有分歧,你如何处理。
- 你快速学习一个新技术并应用到项目。
- 你做过一个有业务 impact 的技术决策。
两周准备计划
第 1-4 天:hands-on coding
练 memory file system、command parser、CSV / JSON transformation、folder hierarchy、OOD chess、simple API endpoint。每题都写 tests。
第 5-8 天:AI product system design
练 enterprise search、document ACL、RAG pipeline、trending queries、recommendation feed、classification pipeline、embedding service。
第 9-11 天:LLM infra trade-off
集中准备 retrieval quality、index freshness、permission sync、latency、batching、model fallback、human review、evaluation metrics。
第 12-14 天:project deep dive + mock
做一轮 45 分钟 project deep dive,再做一轮 AI product design mock。重点看你是否能把技术细节和业务目标连接起来。
相关阅读
- OpenAI 75 分钟 Coding Interview 准备指南:准备 AI lab coding 风格
- Anthropic Coding 和 System Design 面试准备指南:补 AI infra 和 culture round
- xAI Exceptional Software Engineer 面试准备指南:了解高节奏 AI startup 面试
- ML Engineer 面试准备指南:补齐 ML coding 和 ML system design
需要 AI startup 专项 mock?
AI startup 面试最难的是题目不标准、产品上下文强、追问很灵活。Interview Coach Pro 可以按 Glean、Perplexity、Harvey、Scale AI、xAI、OpenAI、Anthropic 这类方向做 coding、AI product system design、project deep dive 和英文表达训练。
相关面试辅导
如果你正在准备类似面试,可以直接从下面的专项辅导开始。