Siyin Wang

Ph.D. Student

Siyin Wang

王嗣尹

Speech LLMs and multimodal full-duplex interaction.

Tsinghua University Beijing, China

Profile

About Me

I am a Ph.D. student at Department of Electronic Engineering, Tsinghua University. My research focuses mainly on speech and audio LLMs, particularly multimodal full-duplex interaction now. My recent work explores multimodal full-duplex interaction, speech quality evaluation with auditory LLMs and speech-based in-context learning.

I am open to academic collaboration on speech, audio, and multimodal intelligence.

Speech and Audio LLMs Multimodal full-duplex Interaction Speech Quality Evaluation In-Context Learning

Updates

News

  1. One co-authored paper is accepted as EMNLP 2026 Findings.
  2. Our review paper on audio LLMs is accepted by Nature Machine Intelligence.
  3. One co-authored paper is accepted by Interspeech 2026.
  4. ELLSA is accepted by ICLR 2026.
  5. SALMONN-omni is accepted by NeurIPS 2025.

Research

Featured Publications

Google Scholar

EMNLP 2026 Findings 2026

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

Haolong Zheng, Siyin Wang, Xulin Fan, Zengrui Jin, Mark Hasegawa-Johnson

An RL post-training method that teaches auditory LLMs to better use few-shot demonstrations for low-resource speech and audio tasks.

Audio LLMs In-Context Learning
Interspeech 2026 2026

Augmenting Dysarthric Speech Severity Assessment with MOS Supervision

Kaimeng Jia, Minzhu Tu, Zengrui Jin, Siyin Wang, Chao Zhang

A study showing how human perceptual supervision from speech quality assessment can improve dysarthric speech severity assessment.

Speech Quality
ICML 2026 Poster 2026

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard

Yudong Yang, Xuezhen Zhang, Zhifeng Han, Siyin Wang, Jimin Zhuang, Zengrui Jin, Jing Shao, Guangzhi Sun, Chao Zhang

A study of compositional speech-audio attacks and mitigation strategies for multimodal LLMs.

Security
ICLR 2025 Poster 2025

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Chen Chen, Yuchen Hu, Siyin Wang, Helin Wang, Zhehuai Chen, Chao Zhang, Chao-Han Huck Yang, Eng Siong Chng

A study showing how audio LLMs can produce descriptive and human-aligned speech quality evaluations.

Speech Quality
ISCSLP 2024 Best Student Paper Candidate 2024

Speaker Diarization for Unlimited Number of Speakers Using Dynamic Linear

Siyin Wang, Chao Zhang

A method for speaker diarization with unlimited number of speakers using dynamic linear.

Speaker Diarization

Training

Education

Bachelor's Degree

Department of Electronic Engineering, Tsinghua University

Excellent Graduates of Tsinghua University (清华大学优良毕业生)
Excellent League Member of Tsinghua University(清华大学优秀共青团员)
Excellent Student Cadre of Tsinghua University(清华大学优秀学生干部)

Ph.D. Student

Department of Electronic Engineering, Tsinghua University

Supervised by Chao Zhang

Research on speech and audio LLMs, multimodal full-duplex interaction, and speech in-context learning.

Work

Experience

Internship

AI Lab, Tencent

Focusing on building large-scale speech encoder and speech-based in-context learning.

Internship

Speech Team, ByteDance

Internship on SALMONN project, focusing on multimodal full-duplex interaction and speech quality evaluation.

Service

Academic Service

Reviewer Service

ICASSP, ASRU, SLT, ACL ARR, ICLR, NeurIPS, IEEE TASLP

Invited Talk

Tutorial on audio LLMs for speech quality at NII, invited by Prof. Junichi Yamagishi, June 2025.

Beyond Research

Life & Moments

World map in equirectangular projection

Map: Natural Earth / Wikimedia Commons